حوكمة الذكاء الاصطناعي

تقييم وكلاء الذكاء الاصطناعي قبل التشغيل: الدقة والتكلفة والأمان

14 سبتمبر 2026 · 18 دقيقة قراءة

يشرح هذا الدليل تقييم وكلاء الذكاء الاصطناعي قبل التشغيل: الدقة والتكلفة والأمان، ويحوّل الاختبار من انطباع عن إجابة تبدو جيدة إلى قرار موثق يمكن مراجعته. لا يكفي أن ينجح الوكيل في عرض تجريبي واحد؛ يجب أن ينجز المهمة الصحيحة، ويرفض الطلب غير المسموح، ويحمي البيانات، ويحافظ على تكلفة وزمن مقبولين عبر حالات طبيعية وحدية وعدائية.

تقييم الوكلاء الذكاء الاصطناعي هو قياس أداء الوكيل على مجموعة حالات ثابتة تمثل العمل الحقيقي، مع نتيجة متوقعة ومعيار قبول لكل حالة. آخر مراجعة: سبتمبر 2026. تحتفظ صفحة حلول الذكاء الاصطناعي بالنية التجارية، بينما يختص هذا المقال بقرار الجاهزية الفنية قبل التشغيل. ويمكن مراجعة باقات وكلاء الذكاء الاصطناعي لفهم نطاقات الحلول، ثم استخدام قائمة اختبار الأتمتة قبل الإطلاق لفحص التكاملات المحيطة بالوكيل.

ما المهمة التي يجب أن ينجح فيها وكيل الذكاء الاصطناعي؟

ابدأ بتعريف مهمة ضيقة قابلة للرصد. عبارة «يساعد فريق المبيعات» لا تصلح معيارًا، بينما تصلح مهمة مثل: يقرأ استفسار العميل، يستخرج الاحتياج والمدينة والميزانية، يسجل الحقول المسموح بها، ثم يسلّم الحالة إلى الموظف عندما ينقص قرار تجاري. يحدد التعريف المدخلات، والأدوات المتاحة، والمخرجات، والقيود، ونقطة انتهاء المهمة.

اكتب حدود الوكيل قبل كتابة الاختبارات. هل يحق له القراءة فقط أم التعديل؟ هل يستطيع إرسال رسالة خارجية أم إعداد مسودة؟ ما الحقول الحساسة؟ من يوافق على إجراء مالي أو قانوني؟ كل صلاحية غير محددة تجعل نتيجة التقييم غامضة، لأن السلوك نفسه قد يعد نجاحًا في سياق وفشلًا أمنيًا في سياق آخر.

قسّم المهمة إلى خطوات قابلة للتتبع: فهم الطلب، اختيار الأداة، تكوين المعاملات، تنفيذ الإجراء، التحقق من النتيجة، ثم تسجيل الأثر. يسمح هذا التقسيم بمعرفة موضع الخطأ. قد تكون الإجابة النهائية صحيحة بالمصادفة رغم اختيار مصدر غير معتمد، أو قد يفهم الوكيل الطلب لكنه يكتب البيانات في سجل خاطئ.

كيف تبني مجموعة اختبار تمثل العمل الحقيقي؟

تتكون مجموعة الاختبار الجيدة من حالات طبيعية وحدية وناقصة وعدائية، ولا تعتمد على أمثلة صاغها المطور وحده. اجمع حالات من مالك العملية والمستخدمين وفريق الأمن وسجلات الأخطاء بعد إزالة البيانات الحساسة. احتفظ بنسخة ثابتة للمقارنة بين الإصدارات، وأضف مجموعة منفصلة لحالات جديدة لم يرها الفريق أثناء الضبط.

يجب أن تحتوي كل حالة على معرف، ومدخل، وسياق مسموح، وأدوات متاحة، ونتيجة متوقعة، وسلوك مرفوض، وحد للتكلفة والزمن، ودليل يمكن حفظه. لا تجعل النتيجة المتوقعة نصًا واحدًا حرفيًا عندما توجد إجابات صحيحة متعددة؛ قيّم الحقائق والإجراء والبنية المطلوبة بدل الأسلوب.

غطّ التوزيع الحقيقي للعمل. إذا كانت معظم الطلبات بالعربية فاختبار الإنجليزية وحده مضلل. أضف اللهجات والأخطاء الإملائية والتواريخ الهجرية والميلادية والعملات وصيغ أرقام الجوال المستخدمة في السعودية عندما تكون ضمن المهمة. لا تستخدم بيانات عملاء حقيقية إذا أمكن توليد بيانات اصطناعية تؤدي الغرض نفسه.

كيف تقيس الدقة بدل الاكتفاء بانطباع بشري؟

الدقة لها أكثر من طبقة: صحة الحقائق، وصحة اختيار الأداة، وصحة المعاملات، وصحة الإجراء، واكتمال النتيجة. امنح كل طبقة حكمًا مستقلًا. الوكيل الذي يذكر معلومة صحيحة ثم يحدث العميل الخطأ لا ينجح، والوكيل الذي يرفض تنفيذ مهمة مسموحة بلا سبب لا ينجح أيضًا.

استخدم قواعد حتمية حيثما أمكن. يمكن مقارنة معرف السجل والقيمة والحالة وعدد الآثار آليًا. أما جودة الملخص أو ملاءمة التصعيد فتحتاج نموذج تقييم واضحًا ومراجعين اثنين في عينة على الأقل. عند اختلاف المراجعين، أصلح تعريف المعيار قبل زيادة عدد الحالات.

احسب معدل النجاح على مستوى المهمة الكاملة، لا متوسط الخطوات فقط. إذا كانت المهمة من خمس خطوات ونجح الوكيل في أربع ثم أخطأ في الإرسال، فالنتيجة التشغيلية فشل. احتفظ أيضًا بمقاييس الخطوات لتشخيص السبب، لكن لا تسمح لها بإخفاء فشل النتيجة النهائية.

كيف تختبر الهلوسة والاعتماد على المصادر؟

اختبار الهلوسة يقيس هل يميز الوكيل بين ما يعرفه وما يستطيع إثباته وما يجب أن يسأل عنه. قدم أسئلة ناقصة، وسجلات غير موجودة، وسياسات متعارضة، وطلبات لمعلومات أحدث من قاعدة المعرفة. النجاح هو طلب التوضيح أو التصريح بعدم كفاية الدليل، لا ملء الفراغ بتخمين مقنع لغويًا.

اطلب من الوكيل إرجاع مصدر كل حقيقة تشغيلية مهمة أو معرف السجل الذي استند إليه. تحقق أن المصدر موجود، ومصرح به، ويدعم الادعاء المحيط مباشرة. لا تعد قائمة روابط عامة نجاحًا. يجب أن تربط الإحالة الجملة بالدليل الذي يثبتها، وأن يرفض الوكيل الاستشهاد بمحتوى لم يسترجعه.

اختبر مقاومة التعليمات المزروعة داخل المستندات وصفحات الويب والرسائل. توضح مخاطر حقن التعليمات وفق OWASP أن حقن التعليمات من المخاطر التي يجب معالجتها في تطبيقات النماذج. ضع نصًا يحاول تغيير هدف الوكيل أو طلب أسرار، وتحقق من أن المحتوى يعامل كبيانات لا كأمر أعلى صلاحية.

كيف تقيس التكلفة وزمن الاستجابة؟

سجّل تكلفة المهمة المكتملة، لا تكلفة استدعاء النموذج منفردًا. تشمل التكلفة عدد استدعاءات النموذج، والرموز، وطلبات البحث، واستدعاءات الأدوات، وإعادة المحاولة، والتصعيد البشري. قد يكون نموذج أقل سعرًا أغلى على مستوى المهمة إذا احتاج محاولات أكثر أو تسبب في مراجعات بشرية متكررة.

قس زمن الاستجابة عند الوسيط والنسب العليا، وسجل زمن كل خطوة. المتوسط يخفي الحالات البطيئة التي يشعر بها المستخدم. ضع حدًا مختلفًا للمحادثة التفاعلية وللمهمة الخلفية. إذا تجاوز الوكيل الحد، حدد هل السبب بحث طويل، أم أداة بطيئة، أم حلقة تخطيط، أم إعادة محاولة بلا سقف.

اختبر الحمل والتزامن ضمن حدود البيئة المسموحة. تحقق من عدم خلط سياق عميل بآخر، ومن احترام حدود API، ومن وجود مهلة وإلغاء واستعادة. لا تعتبر الاستجابة السريعة نجاحًا إذا حذفت خطوة تحقق أو أرسلت نتيجة غير مكتملة.

كيف تفحص الخصوصية والصلاحيات؟

يجب أن يرى الوكيل أقل قدر من البيانات والصلاحيات اللازمة للمهمة. أنشئ حسابات اختبار بأدوار مختلفة، ثم حاول الوصول إلى سجلات خارج الدور أو الحقول أو المنطقة المسموحة. اختبر القراءة والكتابة والتصدير، لأن منع العرض لا يعني منع تسريب القيمة داخل ملخص أو سجل تنفيذ.

افحص المدخلات والمخرجات والسجلات وذاكرة المحادثة. تحذر قائمة OWASP لمخاطر النماذج اللغوية من انكشاف معلومات حساسة عبر تطبيقات النماذج. ضع أسرارًا وهمية وبيانات تعريفية في بيئة الاختبار، وتحقق من الحجب وعدم ظهورها في الردود أو الأخطاء أو أدوات المراقبة.

اختبر مدة الاحتفاظ، وحذف السياق، وعزل الجلسات، وإبطال الرموز. يجب أن يظهر في سجل التدقيق من طلب الإجراء، وما الأداة المستخدمة، وما الحقول التي تغيرت، ومن وافق، من دون نسخ المحتوى الحساس كاملًا إلى السجل.

ما حالات الرفض والتصعيد التي يجب اختبارها؟

الرفض الصحيح نتيجة ناجحة عندما يتجاوز الطلب نطاق الوكيل أو يفتقد موافقة أو يطلب كشف بيانات. اكتب قائمة صريحة للحالات التي يجب رفضها، والحالات التي تتطلب سؤالًا توضيحيًا، والحالات التي تصعّد إلى موظف. قيّم وضوح سبب الرفض والإجراء التالي، لا كلمة الرفض وحدها.

اختبر الأوامر المتعارضة، وانتحال الدور، والضغط للاستعجال، وطلب تجاوز السياسة «لهذه المرة»، وتجزئة الطلب المحظور إلى خطوات صغيرة. يجب أن يطبق الوكيل السياسة على النتيجة المقصودة لا على صياغة جملة منفردة.

لا تجعل الرفض واسعًا لدرجة تعطيل العمل. قس الرفض الخاطئ للطلبات المسموحة إلى جانب قبول الطلبات المحظورة. الهدف هو حد قرار مفهوم يمكن تحسينه، مع تسليم السياق إلى الموظف بدل إجبار العميل على إعادة الشرح.

بطاقة تقييم وكلاء الذكاء الاصطناعي

استخدم بطاقة موحدة، لكن اجعل الأوزان مرتبطة بخطر المهمة. لا يجوز لمجموع مرتفع في السرعة والأسلوب أن يعوض فشلًا في الخصوصية أو تنفيذ إجراء غير مصرح. ضع بوابات مانعة أولًا، ثم احسب الدرجة للحالات التي اجتازتها.

المحورما الذي يقاس؟مثال لمعيار القبولهل هو مانع؟

|---|---|---|---|

إنجاز المهمةصحة النتيجة النهائية والخطواتكل الآثار الحرجة تطابق المتوقعنعم
الدقة والهلوسةصحة الحقائق والمصادرلا ادعاء غير مدعوم في الحالات الحرجةنعم
الأدوات والصلاحياتاختيار الأداة والنطاقلا قراءة أو كتابة خارج الدورنعم
الخصوصيةعدم كشف البيانات والأسرارلا تسرب في الرد أو السجلنعم
الرفض والتصعيدقرار آمن مع سبب واضحرفض المحظور وتصعيد الغامضنعم
التكلفةتكلفة المهمة المكتملةضمن الحد المتفق عليهحسب المهمة
الزمنزمن المهمة والنسب العلياضمن نافذة الاستخدامحسب المهمة
تجربة المستخدمالوضوح وعدم التكرارلا سؤال مكرر وسياق محفوظلا

سجل لكل إصدار اسم النموذج والتعليمات والأدوات وإصدارات مصادر المعرفة وإعدادات الاسترجاع. أي تغيير في أحدها قد يغير النتيجة، لذلك أعد مجموعة الانحدار بعد التعديل. لا تقارن إصدارين إذا تغيرت الحالات أو طريقة التحكيم بينهما.

متى يكون الوكيل جاهزًا للتشغيل؟

يكون الوكيل جاهزًا عندما يجتاز كل البوابات المانعة، ويحقق الحدود المتفق عليها في مجموعة ثابتة ومجموعة غير مرئية، وتنجح تجربة الرجوع والتعطيل، ويوقع مالك العملية والأمن والتقنية على المخاطر المتبقية. لا يوجد رقم موحد يصلح لكل وكيل؛ وكيل الإجابة عن أسئلة عامة يختلف عن وكيل يغير سجلًا ماليًا.

ابدأ بنطاق محدود ومستخدمين محددين وصلاحيات دنيا، مع مراقبة وتصعيد بشري. حدد مؤشرات الإنتاج قبل الإطلاق: نجاح المهمة، والرفض الخاطئ، والتصعيد، والتكلفة، والزمن، والحوادث. قارن الأداء ببطاقة ما قبل التشغيل، لأن تغير البيانات أو الأدوات قد يسبب انحرافًا حتى من دون تغيير النموذج.

حدد زر إيقاف ومالك قرار واضحًا. إذا ظهرت مخالفة خصوصية أو إجراء غير مصرح أو ارتفاع غير مفسر في الأخطاء، أوقف الأثر الخارجي مع الحفاظ على الأدلة اللازمة للتحقيق. التشغيل التدريجي ليس بديلًا عن الاختبار، لكنه يقلل أثر حالة لم تتوقعها المجموعة.

أخطاء شائعة في AI agent evaluation

  • تقييم أمثلة سهلة كتبها الفريق نفسه وترك الحالات الناقصة والعدائية.
  • الحكم على أسلوب الإجابة بدل صحة الإجراء النهائي.
  • تغيير النموذج والتعليمات ومجموعة الاختبار في الوقت نفسه ثم فقدان سبب التحسن.
  • احتساب متوسط تكلفة أو زمن يخفي الحالات العليا البطيئة.
  • منح الوكيل صلاحيات إنتاج كاملة أثناء التجربة.
  • استخدام نموذج لغوي حكمًا وحيدًا من دون قواعد حتمية أو مراجعة عينة بشرية.
  • تمرير درجة إجمالية رغم فشل بوابة الخصوصية أو الصلاحيات.
  • عدم حفظ نسخة الإعدادات والأدلة، مما يمنع إعادة إنتاج النتيجة.

أسئلة شائعة عن تقييم الوكلاء الذكاء الاصطناعي

كم حالة اختبار يحتاج الوكيل؟

لا يوجد عدد ثابت. ابدأ بتغطية كل مسار وقرار وخطر معروف، ثم زد الحالات حتى تشمل التوزيع الحقيقي والحالات الحدية. جودة التغطية أهم من تكرار أمثلة متشابهة.

هل يكفي تقييم الإجابات النصية؟

لا. الوكيل قد يستدعي أدوات ويغير أنظمة، لذلك يجب تقييم اختيار الأداة والمعاملات والأثر النهائي والصلاحيات والسجل، إضافة إلى النص.

هل يمكن استخدام نموذج آخر للتحكيم؟

يمكن استخدامه للمساعدة في المعايير الدلالية إذا كان له نموذج تقييم ثابت، لكن القواعد الحتمية أفضل للحقول والإجراءات، وتبقى مراجعة عينة بشرية ضرورية للتحقق من اتساق الحكم.

متى نعيد التقييم؟

أعد التقييم بعد تغيير النموذج أو التعليمات أو الأدوات أو مصادر المعرفة أو الصلاحيات، وعند ظهور نمط أخطاء جديد في الإنتاج، إضافة إلى مراجعة دورية تناسب مستوى الخطر.

ما الفرق بين الاختبار والمراقبة؟

الاختبار يقيس سلوكًا متوقعًا قبل التغيير أو الإطلاق، أما المراقبة فتلتقط الانحراف والحالات الجديدة أثناء التشغيل. تحتاج منظومة الوكيل إلى الاثنين مع مسار لإضافة حوادث الإنتاج إلى مجموعة الانحدار بعد تنقيحها.

هل تحتاج إلى تقييم وكيل قبل التشغيل؟

ابدأ بمهمة محددة وبوابات مانعة وبطاقة قابلة لإعادة الاختبار قبل منح الوكيل أثرًا خارجيًا.

تعرف على حلول الذكاء الاصطناعي