این الگوی AI Evaluation روشی ساختاریافته برای test کردن سیستمهایی معرفی میکند که خروجیهای آنها کاملاً قطعی نیست.
این الگو برای ارزیابی قابلیتهای مبتنی بر AI طراحی شده است و در سناریوهای دیگری هم کاربرد دارد؛ یعنی جاهایی که کیفیت باید از چند بُعد بررسی شود، نه فقط با نتیجه ساده pass یا fail.
این الگو با قابلیتهای فعلی TestRail یکپارچه است. test runها، planها، milestoneها، reportها، integrationها و API همگی مثل قبل کار میکنند.
چه زمانی از این الگو استفاده کنیم #
از الگوی AI Evaluation زمانی استفاده کنید که لازم است:
-
خروجیهای تولیدشده با AI را ارزیابی کنید؛ مثلاً پاسخهای chatbot یا recommendationها
-
رفتاری را ارزیابی کنید که در اجراهای مختلف تغییر میکند
-
کیفیت را در چند بُعد بسنجید؛ مثلاً accuracy، relevance یا safety
در سناریوهای غیر AI، میتوانید از فیلد نتیجه Quality Rating همراه با الگوهای دیگر برای ارزیابی موارد زیر استفاده کنید:
-
Performance؛ مثلاً سرعت پاسخدهی از نگاه کاربر یا افت عملکرد زیر بار
-
Security و compliance؛ مثلاً مقاومت در برابر prompt injection یا نشت داده
-
هر سیستمی که کیفیت آن را نمیتوان به یک نتیجه دودویی محدود کرد
ایجاد test caseهای AI Evaluation #
هنگام ایجاد یک test case، گزینه AI Evaluation را از فهرست کشویی Template انتخاب کنید.
این الگو همه فیلدهای استاندارد سیستم TestRail را شامل میشود:
-
Title (الزامی)
-
Section (الزامی)
-
Template (الزامی)
-
Type (الزامی)
-
Priority (الزامی)
-
Status (فقط Enterprise)
-
Assigned To (فقط Enterprise)
همچنین از stepهای ساختاریافته همراه با expected result پشتیبانی میکند.
فیلدهای تکمیلی test case #
این الگو فیلدهای اختیاری زیر را برای توصیف سیستم تحت test اضافه میکند:
-
AI Type (فهرست کشویی)
برای دستهبندی سیستم استفاده میشود؛ مثلاً RAG، ML یا LLM -
AI Model (فهرست کشویی)
برای مشخص کردن مدل یا نسخه سیستم استفاده میشود؛ مثلاً GPT یا Gemini
از این فیلدها میتوان برای دستهبندی گستردهتر در سناریوهای غیر AI هم استفاده کرد.
ثبت نتایج #
علاوه بر فیلدهای موجود مثل Status، Comment و Defects، فیلدهای زیر هم در دسترس هستند:
-
Quality Rating (الزامی)
از این فیلد برای ارزیابی کیفیت کلی خروجی AI بر اساس معیارهای تعریفشده، مثل دقت، مرتبط بودن و کامل بودن، استفاده کنید. این فیلد ارزیابی کیفی و یکدستی از نتیجه ارائه میکند. -
Input (اختیاری)
ورودیای را که کاربر یا سیستم به AI داده است، مثل promptها، پارامترها یا boostها، ثبت کنید. این کار به بازتولیدپذیری و debugging کمک میکند. -
Output (اختیاری)
خروجی تولیدشده توسط AI را ثبت کنید، مثل پاسخ chatbot یا محتوای تولیدشده. این کار امکان مقایسه مستقیم با رفتار مورد انتظار را فراهم میکند. -
Traces (اختیاری)
URL مربوط به trace logها را از ابزارهای observability خارجی، مثل Langfuse، وارد کنید. این اطلاعات برای تحلیل عمیقتر و troubleshooting مفید است. -
Latency (اختیاری)
زمان پاسخگویی سیستم AI را ثبت کنید. این کار به پایش performance و شناسایی bottleneckهای احتمالی کمک میکند.
همه فیلدها با result fieldهای موجود در TestRail رفتار یکسانی دارند.

Quality Rating #
فیلد جدید Quality Rating یک result field است که ارزیابی ساختاریافته را با سیستم ستارهای ممکن میکند.
-
هر دسته را میتوان از ۰ تا ۵ ستاره امتیازدهی کرد
-
دستهها از این مسیر قابل تنظیم هستند: Administration → Customisation → Result Fields
-
حداکثر ۱۵ دسته پشتیبانی میشود
-
برای ذخیره result، باید حداقل یک دسته امتیازدهی شده باشد (≥ ۱ ستاره)
دستههای رایج شامل این موارد هستند:
-
صحت اطلاعات
-
مرتبط بودن با intent کاربر
-
انسجام استدلال
-
امنیت و compliance
-
ثبات پاسخها
دستهها کاملاً قابل تنظیم هستند و میتوانید آنها را با نیازهای مختلف testing تطبیق دهید.
استفاده دوباره از Quality Rating در templateها #
Quality Rating فقط به template ارزیابی AI محدود نیست.
مدیران میتوانند این result field را به templateهای دیگر اضافه کنند تا ارزیابی یکدست در این حوزهها پشتیبانی شود:
-
تست AI
-
تست performance
-
تست امنیت
-
و هر مورد دیگری که به insightهای کیفی بیشتری نیاز دارد
وقتی در templateهای دیگر استفاده شود، همان رفتار امتیازدهی و همان dashboardها اعمال میشود.
داشبورد Quality Insights #

وقتی یک test run شامل testهایی با فیلد Quality Rating باشد، یک Quality Insights بخش در دسترس قرار میگیرد.
داشبورد شامل موارد زیر است:
-
میانگین امتیاز کیفیت
میانگین امتیاز کلی برای همه نتایج (از ۵) -
تستهایی که نتیجه دارند
درصد تستهایی که وضعیت نهایی دارند -
کیفیت بر اساس دستهبندی
میانگین امتیاز هر دستهبندی، بر اساس ترتیب پیکربندیشده
رفتارهای دیگر:
-
فقط زمانی نمایش داده میشود که فیلد Quality Rating در test run وجود داشته باشد
-
اگر چنین تستهایی وجود نداشته باشند، بهصورت خودکار پنهان میشود
-
دادهها هر ساعت بهروزرسانی میشوند و امکان refresh دستی هم وجود دارد
-
داشبورد فقط خواندنی است
-
خروجی PDF در دسترس است
فیلتر و مرتبسازی #
وقتی فیلد Quality Rating در یک test run وجود داشته باشد:
-
یک فیلتر دستهبندی در بخش Tests در دسترس است & Results
-
یک Quality Rating گزینه مرتبسازی در دسترس است (پیشفرض: از زیاد به کم)
-
یک ستون Quality Rating نمایش داده میشود
رفتار:
-
فیلتر بر اساس دستهبندی، هم فهرست تستها و هم امتیازهای نمایشدادهشده را بهروزرسانی میکند
-
این ستون میانگین امتیاز هر تست را نشان میدهد
-
با نگهداشتن نشانگر ماوس، امتیازهای همه دستهبندیها نمایش داده میشود
-
اگر هیچ فیلدی از نوع Rating در test run وجود نداشته باشد، کنترلها پنهان میشوند
پیکربندی الگو #
الگوی AI Evaluation از مسیر زیر در دسترس است:
Administration → Customisation → Templates
بهصورت پیشفرض:
-
برای همه projectها در دسترس است
-
بهعنوان الگوی پیشفرض تنظیم نشده است
-
کاملاً قابل ویرایش است
Administratorها میتوانند:
-
نام الگو را تغییر دهند
-
آن را به projectهای انتخابشده محدود کنید
-
case fieldهای پشتیبانیشده را اضافه یا حذف کنید
-
ترتیب fieldها را تغییر دهید
محدودیتها:
-
فیلد نتیجه Quality Rating قابل حذف نیست
-
نام system fieldها رزرو شده است
-
fieldهایی که با «applies to all templates» مشخص شدهاند، بهصورت خودکار اضافه میشوند
سازگاری #
الگوی AI Evaluation کاملاً افزایشی است.
این الگو موارد زیر را تغییر نمیدهد و روی آنها تأثیر نمیگذارد:
-
templateهای موجود
-
case fieldها و result fieldها
-
workflowهای اجرای تست
-
test runها و test planها
-
integrationها و defect tracking
-
رفتار API
-
CLI – بهزودی!
TestRail Academy
تست AI، بازتعریفشده
#
AI دو بار دقیقاً یک پاسخ یکسان نمیدهد؛ بنابراین تست کردن آن مثل نرمافزارهای سنتی دیگر جواب نمیدهد. در این دوره یاد میگیرید چطور خروجیهای AI را در چند بُعد کیفی ارزیابی کنید، از LLM-as-judge برای گسترش تستهای خود کمک بگیرید، و یک چارچوب تکرارپذیر برای ارزیابی مستمر بسازید. حدس زدن را کنار بگذارید و چیزی را اندازهگیری کنید که واقعاً اهمیت دارد.

