الدرس 17: جودة نتائج الذكاء ونظام التقييم
جودة النتيجة
الجودة تتحدد بحسب المهمة. الدقة مهمة في الاستخراج، والاتساق مهم في التصنيف، والوضوح مهم في الكتابة، والاكتمال مهم في التلخيص، والسلامة مهمة في المهام الحساسة. لا يوجد مقياس واحد يصلح لكل استخدام.
معايير التقييم
حوّل الجودة إلى معايير قابلة للملاحظة. في تلخيص اجتماع يمكن قياس تغطية القرارات والمهام، عدم إضافة معلومات غير موجودة، وضوح المسؤوليات، والمحافظة على الأسماء والأرقام.
مجموعة الاختبار
اجمع حالات تمثل الواقع: سهلة، متوسطة، صعبة، واستثنائية. احتفظ بجزء ثابت للمقارنة عبر الإصدارات حتى تعرف إن كان التغيير حسن جانبًا وأفسد جانبًا آخر.
الإجابة المرجعية
في بعض المهام يمكن وجود إجابة صحيحة معروفة مثل استخراج رقم أو تصنيف. وفي المهام المفتوحة قد تحتاج معايير تقييم أو مراجعين بدل إجابة واحدة.
التقييم الآلي والبشري
التقييم الآلي مفيد للسرعة والكميات الكبيرة، لكنه قد لا يلتقط جودة أسلوب أو ملاءمة سياق. التقييم البشري أكثر تكلفة لكنه ضروري في عينات وفي المعايير التي تعتمد على الحكم.
الدقة والاستدعاء
في مهام الكشف والتصنيف قد تحتاج الموازنة بين اكتشاف أكبر عدد من الحالات وتقليل الإنذارات الخاطئة. لا تختار العتبة دون فهم تكلفة كل نوع خطأ.
معدل الخطأ المقبول
يتحدد حسب الأثر. خطأ 2% قد يكون مقبولًا في اقتراح عناوين، وغير مقبول في استخراج مبالغ مالية تنفذ تلقائيًا. تصميم الحلقة البشرية يتغير مع مستوى المخاطر.
الانحراف بمرور الوقت
قد يتغير نوع المدخلات أو سلوك المستخدمين أو السياسات. لذلك الجودة ليست اختبارًا مرة واحدة؛ تحتاج مراقبة عينات، مقارنة دورية، وتحديث مجموعة الاختبار.
تسجيل الأخطاء
صنف الأخطاء: فقد معلومة، اختلاق، تصنيف خاطئ، عدم اتباع صيغة، سوء فهم سياق، أو فشل أداة خارجية. التصنيف يسمح بمعالجة السبب المناسب بدل تعديل التعليمات عشوائيًا.
استخدام الذكاء
يمكن استخدام نموذج مستقل كمراجع أولي للنتائج أو لاستخراج أنماط من تقارير الأخطاء، لكن لا تعتمد عليه كمقياس وحيد لنموذج آخر. عند القرارات المهمة تحتاج عينة بشرية ومعايير واضحة.