کاربرد را قبل از مدل انتخاب کنید
پاسخ روان ممکن است اشتباه باشد. مشخص کنید خروجی برای خلاصه سند، پاسخ از راهنما یا پیشنهاد متن استفاده میشود. هر کاربرد معیار متفاوتی دارد. این قالب برای پاسخ فارسی مستند است و رتبهبندی عمومی مدلها نیست.
پنج معیار
- صحت ادعا نسبت به شاهد.
- کاملبودن پاسخ به سؤال اصلی.
- وفاداری به اطلاعات منبع.
- وضوح و قابلفهمبودن فارسی.
- اعلام نبود اطلاعات در موارد مبهم.
برای هر معیار تعریف قبول و رد بنویسید. اگر تاریخ در سند نیست، ساختن تاریخ رد میشود؛ حتی اگر جمله طبیعی باشد. خطای مهم را از ایراد نگارشی جدا ثبت کنید.
مقایسه روی مسئله یکسان
مجموعه ثابت سؤال و سند آماده کنید. پرامپت، نسخه مدل، تاریخ و تنظیمات را کنار خروجی نگه دارید. داده محرمانه را حذف کنید. پاسخها را با نامهای A و B بررسی کنید تا برند کمتر روی قضاوت اثر بگذارد. نمونههای مرزی را دوباره اجرا کنید؛ یک پاسخ خوب، پایداری را ثابت نمیکند.
گزارش
تعداد نمونه، موارد قبول، نوع خطا و محدودیت آزمون را نشان دهید. نتیجه ده سؤال را به همه کاربردها تعمیم ندهید. سرعت، کیفیت و هزینه را جدا ثبت کنید. این صفحه نتیجه مقایسه مدل خاصی نیست؛ فایل دانلودی قالب خالی آزمایش شماست. پس از تغییر مهم پرامپت یا ابزار، همان مجموعه را دوباره اجرا کنید. خطای تازه را با داده غیرشخصی به آزمونها اضافه کنید. شروع دستی مفید است؛ برای خودکارسازی به راهنمای evals مراجعه کنید.