عندما يصل النظام الى نقطة حيث breaking_point تكون دائما None (لا يوجد مستوى يكسر فيه)،
هذا يعني ان المعيار اصبح مشبعا - النظام تعلم كيف يجتاز الاختبارات بدون ان يتحسن فعلا.
breaking_point: nullفي كل التقارير- نسبة نجاح 100% في كل مستويات المنهج
- عدم وجود تمييز بين الاستجابات الجيدة والسطحية
بدلا من تغيير نص المهمة فقط (lexical_soften, brevity_lure, etc.)، نغير العقد نفسه - القواعد التي يتم التحقق منها.
اذا كان النظام يجتاز التحقق دائما، فالمشكلة ليست في النظام بل في التحقق. نحتاج ان نجعل التحقق اصعب بطريقة تكشف نقاط الضعف الحقيقية.
يضيف خاصية مطلوبة جديدة لا تستطيع الاستجابات النمطية تلبيتها.
- مثال: اضافة "quantitative cost-benefit ratio" لمهمة مقارنة
يزيل خاصية مطلوبة لاختبار ان التحقق ينجح فعلا عندما يكون اسهل.
- اذا فشل التحقق حتى بعد الازالة، هناك خلل في التحقق
يضيف اختصار محظور يستهدف الاستجابات النمطية.
- مثال: "formulaic comparison structure" يمنع المقارنات الآلية
ينقل خاصية مطلوبة الى المحظورات والعكس.
- نفس النص، معايير نجاح مقلوبة - يختبر ان التحقق يقرأ العقد فعلا
يجعل كل الخصائص الزامية بدون درجات جزئية.
- يكشف النظام الذي يمرر "تقريبا صحيح" كنجاح
يبدل كل الخصائص المطلوبة مع كل المحظورات.
- اختبار ان النظام لا يحفظ الاجابات بل يتبع العقد
يأخذ نتيجة المستوى 5 (اقصى ضغط نصي) ويضيف ضغط العقد.
- يكشف: هل النظام يعتمد على النص ام العقد؟
اقصى ضغط عقدي - العقد مقلوب ومشدد.
- يكشف: هل التحقق صوري ام حقيقي؟
- 5.65: CheckList (Ribeiro et al. 2020) - اختبار الحد الادنى للوظائف
- 5.66: Contrast Sets (Gardner et al. 2020) - تعديل ادنى يقلب النتيجة
- 5.67: Counterfactual Data (Kaushik et al. 2020) - نفس النص، علامة مقلوبة
- 5.68: Dynabench (Kiela et al. 2021) - معيار ديناميكي عدائي