Skip to content
ذكاء اصطناعي·٠٣ أبريل ٢٠٢٦·11 دقيقة قراءة

تطوير الذكاء الاصطناعي بالتقييم

توقف عن التحقق العاطفي من نموذجك. سير عمل عملي لإطلاق ميزات ذكاء اصطناعي يمكن الدفاع عنها في الإنتاج.

كل ميزة ذكاء اصطناعي أطلقتها في السنتين الماضيتين بدأت بنفس الأداة: جدول بـ ١٠٠ حالة اختبار. لا prompt. لا نموذج. جدول. هذا هو التطوير المُقاد بالتقييم، وهو الطريقة الوحيدة التي وجدتها لإطلاق ميزات LLM لا تخجلك في الإنتاج.

إليك سير العمل. قبل كتابة أي كود للنموذج، اكتب حالات الاختبار. خذ مدخلات حقيقية سيعطيها المستخدم للنموذج، اكتب المخرجات المثالية، وقيّم كل مخرج على مقياس ١-٥. الآن لديك خط أساس. عند تغيير الـ prompt أو النموذج أو خط الاسترجاع، أعد تشغيل الحالات الـ ١٠٠ وانظر إن كان متوسطك ارتفع أم انخفض.

الفخ الذي يقع فيه أغلب الفرق هو الاختبار على المسار السعيد. يجربون ٥ أمثلة، تعمل، ويُطلقون. ثم يسأل مستخدم النموذج شيئًا مختلفًا قليلًا فيهلوس استشهادًا. نظام التقييم يلتقط هذا لأنك كتبت حالات للمدخلات الغريبة أيضًا — العدائية، والملتبسة، وبالعربية، والتي لا جواب جيد لها.

الذكاء الاصطناعي الإنتاجي يحتاج أكثر من التقييمات، لكن التقييمات هي الأساس. تحتاج أيضًا تتبّعًا (كل إجابة تربط بفقرات المصدر)، وحواجز (النموذج لا يقول شيئًا غير قانوني)، ومراقبة تكلفة (مستخدم واحد لا يفلسك). لكن كل ذلك ثانوي مقابل وجود تعريف قابل للقياس لـ 'المخرج الجيد' أصلاً.

إن أخذت شيئًا واحدًا من هذه المقالة: اكتب حالات الاختبار أولًا. لا بعد. لا أثناء. أولًا. النموذج هو الجزء السهل — معرفة معنى 'الجيد' هو الصعب، والتقييمات تجبرك على معرفة ذلك قبل كتابة سطر كود واحد.