مدل‌ها و روش‌ها

قالب ارزیابی پاسخ فارسی LLM؛ آزمون تکرارپذیر

ثبت سؤال، شاهد، معیار و خطا برای مقایسه مدل‌ها در یک کاربرد مشخص.

تحریریه کارآفرین‌شو

تهیه با کمک AI؛ مثال‌های آموزشی از نتایج آزمایش‌شده تفکیک شده‌اند. روش انتشار

کاربرد را قبل از مدل انتخاب کنید

پاسخ روان ممکن است اشتباه باشد. مشخص کنید خروجی برای خلاصه سند، پاسخ از راهنما یا پیشنهاد متن استفاده می‌شود. هر کاربرد معیار متفاوتی دارد. این قالب برای پاسخ فارسی مستند است و رتبه‌بندی عمومی مدل‌ها نیست.

پنج معیار

برای هر معیار تعریف قبول و رد بنویسید. اگر تاریخ در سند نیست، ساختن تاریخ رد می‌شود؛ حتی اگر جمله طبیعی باشد. خطای مهم را از ایراد نگارشی جدا ثبت کنید.

مقایسه روی مسئله یکسان

مجموعه ثابت سؤال و سند آماده کنید. پرامپت، نسخه مدل، تاریخ و تنظیمات را کنار خروجی نگه دارید. داده محرمانه را حذف کنید. پاسخ‌ها را با نام‌های A و B بررسی کنید تا برند کمتر روی قضاوت اثر بگذارد. نمونه‌های مرزی را دوباره اجرا کنید؛ یک پاسخ خوب، پایداری را ثابت نمی‌کند.

گزارش

تعداد نمونه، موارد قبول، نوع خطا و محدودیت آزمون را نشان دهید. نتیجه ده سؤال را به همه کاربردها تعمیم ندهید. سرعت، کیفیت و هزینه را جدا ثبت کنید. این صفحه نتیجه مقایسه مدل خاصی نیست؛ فایل دانلودی قالب خالی آزمایش شماست. پس از تغییر مهم پرامپت یا ابزار، همان مجموعه را دوباره اجرا کنید. خطای تازه را با داده غیرشخصی به آزمون‌ها اضافه کنید. شروع دستی مفید است؛ برای خودکارسازی به راهنمای evals مراجعه کنید.

منابع برای ادامهٔ مطالعه