چرا این موضوع مهم است؟
بدون متریک، دستیار هوش مصنوعی رایگان یا پولی فقط «خوب به نظر میرسد». Perplexity برای مدل زبانی، BLEU/ROUGE/METEOR/BERTScore برای تولید متن، Exact Match و F1 برای QA، و Pass@k برای کد رایجاند. Human Evaluation همچنان طلایی است.
کارتهای مفهومی
Perplexity / BLEU / ROUGE
متریکهای کلاسیک تولید
Faithfulness / Groundedness
حیاتی برای RAG
Hallucination / Toxicity
ایمنی و اعتماد
Latency / Token/sec
عملیات و هزینه

در عمل چه کار کنیم؟
در RAG، Faithfulness و Groundedness حیاتیاند: پاسخ باید به اسناد بازیابیشده بچسبد. Hallucination Rate، Toxicity، Latency و Token/sec بُعد عملیات را کامل میکنند. در عمل، ۵۰–۱۰۰ سوال واقعی را برچسب بزنید، هر تغییر پرامپت یا ایندکس را رگرسیون کنید و Latency را کنار faithfulness ببینید. برای دستیار هوشمند فروش، نرخ تبدیل را هم در کنار دقت پاسخ ثبت کنید.
برای تیمهای فارسیزبان، این مرحله یعنی تعریف intentهای واقعی، آمادهسازی پایگاه دانش قابل استناد، و اتصال چت بات سایت یا کانالهای پیامرسان به همان منبع حقیقت—نه تکیه بر حافظهٔ عمومی مدل. اگر هنوز میپرسید دستیار هوشمند چیست، معیار عملی این است: پاسخ باید از سند تأییدشده بیاید، قابل ارزیابی باشد و در ابهام به کارشناس ارجاع دهد.
نکات طلایی مصاحبه
- در RAG، Faithfulness از BLEU مهمتر است.
- Human Eval را حذف نکنید.
- Latency را همراه کیفیت بسنجید.
پیشنهاد سایماتک
کیفیت را اندازه بگیرید
ارزیابی Faithfulness را از روز اول در پایلوت دستیار هوشمند بگذارید.
جمعبندی کاربردی
برای دستیار هوشمند فارسی، مجموعه تست از سوالات واقعی بسازید. مرکز دانش و محصول سایماتک روی همین حلقه کیفیت تأکید دارند.
آماده شروع هستید؟
آمادهاید از دستیار هوشمند RAG استفاده کنید؟
همین حالا با ما تماس بگیرید و از مشاوره رایگان بهرهمند شوید. اگر میخواهید بدانید دستیار هوشمند چیست و چطور یک چت بات فارسی روی سایت شما کار میکند، تست رایگان و دمو بهترین قدم بعدی است. برای سوال سریع هم میتوانید از دستیار گوشه صفحه — صحبت با هوش مصنوعی آنلاین — کمک بگیرید.
اگر پلن فعال ندارید به بخش پلنهای قیمتگذاری هدایت میشوید؛ در غیر این صورت وارد پنل میشوید. نصب دستیار و راهاندازی چت بات سایت معمولاً چند دقیقه طول میکشد.


