كل المقالات

اختر نموذج الذكاء الاصطناعي المناسب لشركتك عبر اختبار من 20 سؤالاً

قبل ربط مستنداتك الخاصة أو الدفع مقابل نموذج أكبر، اختبر أسئلة العمل الفعلية باستخدام مجموعة تقييم بسيطة.

·6 دقائق قراءة
مشاركةXLinkedInWhatsAppTelegram

اختيار نموذج للذكاء الاصطناعي بناءً على شهرته أو سعره أو عرض تجريبي مصقول قد يكون بداية مكلفة. فالنموذج الذي يكتب نصوصاً تسويقية ممتازة قد يقدم إجابات غير موثوقة عن سياسة الإرجاع أو كتالوج المنتجات أو الإجراءات الداخلية.

يمكنك هذا الأسبوع جعل القرار أكثر عملية: أنشئ مجموعة تقييم صغيرة من أسئلة العمل الحقيقية، ثم استخدمها لمقارنة النماذج وأساليب الاسترجاع. لا تحتاج إلى قاعدة بيانات ضخمة أو مشروع ذكاء اصطناعي يستمر ستة أشهر. ما تحتاجه هو أسئلة تمثل الواقع، ومعايير نجاح واضحة، واختبار مضبوط.

ابدأ بـ20 سؤالاً حقيقياً

أنشئ قائمة بالأسئلة التي يطرحها فريقك أو عملاؤك أو العملاء المحتملون فعلياً. تجنب الأسئلة المصممة لإظهار الذكاء الاصطناعي بصورة مثالية. أدرج الأسئلة غير المكتملة، والمربكة، والحساسة أيضاً.

على سبيل المثال، قد يجمع متجر إلكتروني أسئلة مثل:

  • «هل يمكنني إرجاع منتج مخفّض اشتريته قبل ثلاثة أسابيع؟»
  • «ما نوع قماش الأريكة الأسهل في التنظيف إذا كان لدي حيوانات أليفة؟»
  • «هل هذا المنتج متوفر في فرع دبي؟»
  • «لخّص قواعد التوصيل للطلبات التي تتجاوز قيمة معينة.»
  • «أحتاج إلى قطعة بديلة، لكنني لا أعرف رمز المنتج.»

استهدف 20 إلى 30 سؤالاً ضمن حالة الاستخدام الأساسية. إذا كنت تبني مساعداً داخلياً، فاطلب من الموظفين مشاركة الأسئلة المتكررة من البريد الإلكتروني أو WhatsApp أو تذاكر الدعم أو المستندات المشتركة. أما إذا كنت تبني مساعداً موجهاً للعملاء، فاستخدم أسئلة مجهّلة الهوية من المحادثات وبيانات البحث.

صنّف كل سؤال حسب نوعه:

  • معلومة معروفة: يجب أن تكون الإجابة متاحة مباشرة في مستند أو قاعدة بيانات.
  • متعدد الخطوات: يجب على المساعد جمع معلومات من أكثر من مصدر.
  • غامض: ينبغي للمساعد طرح سؤال توضيحي.
  • خارج النطاق: يجب أن يوضح المساعد أنه لا يستطيع المساعدة.
  • حساس: يجب على المساعد تجنب كشف معلومات خاصة أو مقيّدة.

هذا التصنيف مهم لأن النظام المفيد ليس النظام الذي يجيب عن كل سؤال. بل هو النظام الذي يجيب عن الأسئلة المناسبة، ويطلب التوضيح عند الحاجة، ويرفض بأمان عندما لا تتوفر المعلومات.

حدّد معنى «الإجابة الجيدة» قبل الاختبار

لا تقارن النماذج باستخدام انطباع عام مثل «النموذج A يبدو أذكى». اكتب السلوك الذي تحتاج إليه لكل سؤال.

لكل اختبار، سجّل ما يلي:

  1. الإجابة أو المصدر المتوقع: ماذا يجب أن يقول المساعد، أو أي مستند ينبغي أن يدعم الإجابة؟
  2. التفاصيل التي يجب تضمينها: مثل المهلة المحددة للإرجاع، أو النموذج المطلوب، أو قيود التوصيل.
  3. التفاصيل التي يجب عدم فعلها: مثل اختراع خصم، أو كشف هامش ربح داخلي، أو الوعد بموعد توصيل غير مؤكد.
  4. البديل المقبول: ماذا يجب أن يقول المساعد إذا لم تكن الإجابة متاحة؟
  5. قاعدة التصعيد: متى يجب تحويل السؤال إلى موظف؟

يكفي استخدام نظام تقييم بسيط في الجولة الأولى. امنح كل إجابة درجة من 0 إلى 2:

  • 0: إجابة خاطئة أو غير آمنة أو مختلقة بثقة.
  • 1: مفيدة جزئياً، لكنها تفتقد تفصيلاً مهماً أو تحتاج إلى تصحيح.
  • 2: صحيحة، ومدعومة بالمصدر المناسب، ومكتوبة بالأسلوب المطلوب.

يمكنك أيضاً متابعة زمن الاستجابة والتكلفة التقريبية لكل سؤال. هذه أمثلة وليست أهدافاً عامة ثابتة. فقد يحتاج مساعد موجه للعملاء إلى إجابات سريعة، بينما يمكن لأداة بحث داخلية أن تتحمل استجابة أبطأ إذا كانت أكثر موثوقية.

اختبر ثلاثة إعدادات، لا ثلاثة نماذج فقط

تركز الشركات غالباً على اختيار النموذج وتتجاهل النظام المحيط به. عملياً، يمكن للنموذج نفسه أن يقدم نتائج مختلفة تماماً بحسب التعليمات، واسترجاع المستندات، وضوابط المخرجات.

شغّل أسئلتك العشرين عبر ثلاثة إعدادات أساسية:

1. خط أساس يعتمد على النموذج فقط

قدّم للنموذج تعليماتك، من دون مستندات الشركة الخاصة. يوضح ذلك ما يعرفه النموذج مسبقاً والمجالات التي يُرجح أن يخمّن فيها.

يظل خط الأساس مفيداً حتى إذا كنت تعرف أنك ستحتاج إلى بيانات خاصة. فهو يساعدك على معرفة ما إذا كان السؤال يحتاج إلى الاسترجاع أصلاً، كما يمنحك نقطة مقارنة للتحسينات اللاحقة.

2. RAG مع مجموعة صغيرة ونظيفة من المستندات

اربط فقط المستندات المطلوبة لحالة الاستخدام المحددة. قد تشمل هذه المستندات سياسة الإرجاع الحالية، ودليل التوصيل، ومعلومات المنتجات، وإجراءات التصعيد.

تتيح تقنية RAG، أو التوليد المعزّز بالاسترجاع، للنظام العثور على المقاطع ذات الصلة من بياناتك الخاصة واستخدامها عند إعداد الإجابة. لكنها لا تجعل المستندات الضعيفة موثوقة تلقائياً. فإذا احتوى ملفان على مدتين مختلفتين للإرجاع، فقد يقدم المساعد إجابة متناقضة ما لم تحدد أي مصدر هو الأحدث والمعتمد.

قبل الاختبار، احذف النسخ المكررة، وأرشف الإصدارات القديمة، وأضف عناوين وتواريخ واضحة. عادةً ما تكون قاعدة المعرفة الأصغر والمحافظة عليها جيداً أسهل في التقييم من مجلد ضخم يضم كل ما كتبته الشركة منذ تأسيسها.

3. RAG مع التعليمات وضوابط الحماية

أضف قواعد لاستخدام المصادر، والتعامل مع عدم اليقين، والتصعيد إلى الموظفين. على سبيل المثال:

  • أجب عن أسئلة السياسات بالاعتماد على المستندات المعتمدة فقط.
  • إذا لم تدعم المواد المسترجعة الإجابة، اذكر ذلك بوضوح.
  • لا تنشئ سعراً أو مستوى مخزون أو وعداً بالتوصيل أو قراراً بشأن استرداد الأموال.
  • اطلب رقم الطلب فقط من خلال مسار آمن ومعتمد.
  • حوّل الشكاوى والأسئلة القانونية والاستثناءات إلى موظف مختص.

يوضح الاختبار الثالث الفرق بين «النموذج يعرف الإجابة» و«الشركة تستطيع استخدام النظام بأمان».

استخدم النتائج لاتخاذ قرار عملي

راجع حالات الفشل حسب فئتها، بدلاً من اختيار الإعداد صاحب أعلى متوسط درجات. فقد تكون هلوسة واحدة خطيرة أهم من عدة مشكلات بسيطة في الأسلوب.

إذا حقق خط الأساس المعتمد على النموذج أداءً جيداً في الأسئلة العامة لكنه فشل في تفاصيل السياسات، فمن المرجح أنك تحتاج إلى طبقة استرجاع. وإذا أعاد RAG مقاطع غير مرتبطة أو متعارضة، فحسّن المستندات وإعدادات الاسترجاع قبل تغيير النموذج. أما إذا كانت الإجابات دقيقة لكن المساعد يستغرق وقتاً طويلاً أو يكلف كثيراً، فاختبر نموذجاً أصغر للأسئلة البسيطة، واحتفظ بالنموذج الأقوى للحالات المعقدة.

قد تبدو سياسة التوجيه العملية على النحو التالي:

  • استخدم نموذجاً أقل تكلفة للتصنيف، والتنسيق، وعمليات البحث البسيطة.
  • استخدم نموذجاً أقوى للأسئلة التي تتطلب الجمع بين عدة مستندات أو صياغة دقيقة.
  • اشترط الاسترجاع عند التعامل مع معلومات خاصة.
  • صعّد الطلبات منخفضة الثقة أو الحساسة أو عالية التأثير إلى موظف.

على سبيل المثال، إذا كان متجرك يستقبل 300 سؤال من العملاء أسبوعياً، فيمكنك توجيه أسئلة أوقات العمل عبر مسار خفيف، وإرسال أسئلة توافق المنتجات إلى سير عمل يدعم الاسترجاع. ستعتمد الأرقام وقواعد التوجيه على نشاطك؛ أما المبدأ فهو مواءمة التكلفة والقدرة مع طبيعة المهمة.

قائمة تنفيذ خلال أسبوع واحد

اليوم الأول: اجمع الأسئلة

اجمع 20 إلى 30 سؤالاً حقيقياً ومجهّل الهوية، وصنّف أنواعها. أدرج عدة أمثلة على الأسئلة الغامضة أو الخارجة عن النطاق على الأقل.

اليوم الثاني: جهّز المصادر

اختر المستندات التي ينبغي أن تدعم الإجابات. احذف الإصدارات القديمة وحدد الشخص المسؤول عن إبقاء كل مصدر محدثاً.

اليوم الثالث: اكتب قواعد القبول

حدّد الإجابات الصحيحة، والسلوكيات الممنوعة، وصياغة الرد البديل، ومتى يجب التصعيد. اجعل القواعد محددة بما يكفي ليطبقها شخص آخر بطريقة متسقة.

اليوم الرابع: نفّذ المقارنة

اختبر إعدادات النموذج فقط، وRAG، وRAG مع ضوابط الحماية. سجّل الإجابات والمصادر وحالات الفشل وزمن الاستجابة والتكلفة المقدّرة.

اليوم الخامس: حدّد نطاق الإنتاج الأول

اختر سير عمل واحداً ومحدداً بحدود واضحة. وثّق النموذج والمصادر وضوابط الحماية وقواعد تسليم الحالة إلى موظف. احتفظ بمجموعة التقييم لاستخدامها كاختبار تراجعي مع كل تغيير مستقبلي.

كيف يمكن لـ ADMOV مساعدتك

تساعد ADMOV الشركات على إعداد أنظمة LLM ودمجها ضمن سير العمل الفعلي، بدلاً من الاكتفاء بعروض روبوتات محادثة عامة. يمكننا مساعدتك في تحويل أسئلة شركتك إلى مجموعة تقييم، وتنظيف المستندات الخاصة وربطها عبر إعداد RAG، وتعريف ضوابط الحماية ومسارات التصعيد، ومقارنة خيارات النماذج وفق متطلبات الموثوقية والتكلفة.

ويمكن أن تتحول مجموعة الاختبار نفسها إلى فحص جودة مستمر مع تغيّر مستنداتك أو تعليماتك أو نماذجك. احجز مكالمة مجانية عبر https://admov.io/#contact لمناقشة أول سير عمل تريد تقييمه.

#LLM integration#RAG#AI evaluation

المزيد من المدونة