Kodokon kodokon.com

التحقق من أجوبة الذكاء الاصطناعي: التوثيق، الاختبارات، الهلوسات

تبنَّ ردود الفعل الثلاثة للممارس - المقابلة بالتوثيق الرسمي، والاختبار بنفسك، وتصيّد إشارات الهلوسة - قبل دمج أي شيء.

9 دقيقة · 3 أسئلة

افتح هذا الدرس في Kodokon

الهلوسة ليست جوابا سخيفا: بل جوابا معقولا وخاطئا - دالة يُفترض أن توجد لكنها لا توجد، خيار أُعيدت تسميته منذ إصدارين، سلوك افتراضي مقلوب. وهذا بالضبط ما يجعل المطورين الأكفاء عرضة للخطر: فالكود المهلوَس اصطلاحي، حسن التسمية، متسق مع النظام البيئي. يبدو صحيحا. ثلاثة ردود فعل غير قابلة للتفاوض قبل دمج أي شيء: المقابلة بالتوثيق الرسمي للإصدار الذي تستعمله، واختبار الكود بنفسك في سياق مصغّر، وتدقيق الجواب - بما في ذلك بواسطة النموذج ذاته.

PROMPT
خذ جوابك السابق ودقّقه كأنه صادر عن شخص آخر.

1. اذكر كل ادعاء تقني قابل للتحقق: اسم API أو دالة، سلوك موصوف، قيمة افتراضية، رقم إصدار.
2. لكل منها، أعطِ مستوى ثقتك: مؤكد / مرجح / يستوجب التحقق.
3. لكل "يستوجب التحقق"، اذكر بالضبط ما يجب البحث عنه في التوثيق الرسمي: اسم الصفحة أو الدالة أو الوحدة المعنية.
4. أشر إلى كل ما قد يتوقف على الإصدار أو المنصة، محددا من أي إصدار يسري إن كنت تعرف.

كن أقسى على نفسك مما سأكون: ادعاء مبالغ في تقديره كـ"مؤكد" يكلفني أكثر من ادعاء مقلَّل من قدره.
موجّه: التدقيق الذاتي - حوّل الجواب إلى قائمة تحقق مما يجب التحقق منه

هذا التدقيق الذاتي لا يثبت شيئا - قد يكون النموذج واثقا ومخطئا - لكنه يحوّل النثر السلس إلى قائمة حقائق قابلة للتحقق، لكل منها نقطة دخولها إلى التوثيق. أنت من يتحقق؛ والذكاء الاصطناعي كل ما فعله أنه هيّأ الأرض. وتعلّم أيضا رصد الإشارات الحمراء: API مقصوصة تماما لتلائم حاجتك (أجمل من أن يكون حقيقيا)، مزيج من أعراف إصدارات مختلفة في المقتطف ذاته، ثقة متجانسة تماما - الخبرة الحقيقية تقول "يعتمد على..."؛ أما الهلوسة فلا تقول ذلك أبدا - وغياب أي ذكر لحد أو حالة حدية. لا إشارة منفردة دليل، لكن كل واحدة ينبغي أن تطلق تحققا.

PROMPT
لقد ادّعيت للتو أن [ادعاء دقيق يستوجب التحقق].

1. ساعدني على تصميم أقصر اختبار ممكن للتحقق منه بنفسي: الملف المصغّر الذي يجب إنشاؤه، الأمر الدقيق الذي يجب تشغيله، النتيجة الدقيقة التي يجب أن ألاحظها إن كنت على حق - وما سألاحظه بدلا من ذلك إن كنت مخطئا.
2. ثم كن محامي الشيطان: في أي حالات يكون ادعاؤك خاطئا؟ الإصدار، المنصة، الإعداد، الوضع الصارم أو لا - مُرّ على كل شيء.

سأشغّل الاختبار بنفسي: لا تطلب مني أن آخذ بكلامك، بل أعطني وسائل تكذيبك.
موجّه: الاختبار المصغّر القابل للتفنيد - الذكاء الاصطناعي يساعدك على تكذيبه

يطبّق هذا الموجّه مبدأ علميا على العمل اليومي: الادعاء يساوي شيئا إن كان قابلا للتفنيد - إن كنت تعرف ما ستلاحظه لو تبيّن أنه خاطئ. عشرة أسطر في ملف يُرمى وتشغيلة واحدة تتفوق على كل مستوى ثقة معلَن. وللمقابلة بالتوثيق، ثلاث عادات: تحقق في توثيق إصدارك أنت (النماذج تخلط بمرح بين حقب الـAPI الواحد)، وراجع سجل التغييرات (changelog) حين يبدو أن سلوكا قد تغير، وأبقِ REPL أو ملف مسوَّدة مفتوحا دائما - ينبغي أن تكون كلفة التحقق منخفضة جدا بحيث لا يكون لديك عذر لتخطي الخطوة.

اختبار المعرفة

تأكّد من أنك تذكّرت النقاط الأساسية في هذا الدرس.

  1. ما الذي يجعل هلوسة الذكاء الاصطناعي خطيرة على مطور كفؤ؟
    • أنها سخيفة وتضيّع وقت قراءتها
    • أنها معقولة: كود اصطلاحي، أسماء متسقة مع النظام البيئي، ثقة مؤكدة
    • أنها لا تخص إلا التقنيات الحديثة
  2. يدّعي الذكاء الاصطناعي أن خيار إعداد موجود. أي تحقق هو الفيصل؟
    • سؤاله "هل أنت متأكد؟" ورؤية ما إذا كان يثبت على جوابه
    • طرح السؤال نفسه على ذكاء اصطناعي آخر والمقارنة
    • التوثيق الرسمي لإصدارك، أو اختبار مصغّر تشغّله أنت
  3. أي مما يلي إشارة حمراء على الهلوسة؟
    • الجواب يذكر الحدود والحالات الحدية
    • الجواب يقول "يعتمد على..." ويفصّل الحالات
    • API مقصوصة تماما لتلائم حاجتك، مقدَّمة بلا تحفظ أو فرق دقيق
    • الجواب يستشهد برقم الإصدار الذي تغير فيه السلوك