قد يتفاجأ البعض عندما يحصلون على إجابات مختلفة من نموذج الذكاء الاصطناعي عند طرح السؤال ذاته بصيغ متعددة، أو حتى عند طرحه بلغات مختلفة، رغم أن المعنى المقصود لا يتغير كثيرا.
ويظهر هذا التفاوت في دقة المعلومات والمصطلحات والتفاصيل التي يستحضرها النموذج، وقد يمتد إلى طريقة فهم السياق الثقافي، وهو ما يرتبط ببيانات التدريب وطريقة تمثيل كل لغة داخل النموذج.
وتعرف هذه الظاهرة في الأبحاث المتعلقة بالنماذج اللغوية بـ'حساسية المطالبة'، وتشير إلى أن اختلاف صياغة الطلب أو نبرته أو ترتيب جمله قد يدفع النموذج إلى إنتاج إجابات مختلفة للموضوع ذاته. فعلى سبيل المثال، قد يركز سؤال عن مخاطر الطاقة النووية على الجوانب السلبية، بينما يؤدي سؤال يتناول إيجابياتها وسلبياتها إلى إجابة أكثر شمولا، رغم تناول السؤالين الموضوع نفسه.
ويرتبط هذا السلوك بالطريقة التي تعالج بها النماذج اللغوية النصوص، ففي البداية، يجري تحويل النص إلى وحدات صغيرة تعرف باسم الرموز، ثم تستخدم آلية الانتباه لتحديد العلاقات والأوزان بين أجزاء النص، قبل أن يحسب النموذج احتمالات الكلمات أو الرموز التي يمكن أن تأتي لاحقا. ولذلك فإن أي تغيير في المدخلات يمكن أن يؤثر في المسار الذي يتبعه النموذج أثناء توليد الإجابة.
ولا تقتصر آثار هذه الحساسية على اختلاف أسلوب الإجابات، إذ يمكن أن تسهم بعض الصياغات في ظهور مخرجات متحيزة أو معلومات غير دقيقة، كما يمكن استغلالها في هجمات حقن الأوامر، التي تهدف إلى دفع النماذج أو الأنظمة المعتمدة عليها إلى تجاوز التعليمات الموضوعة لها أو تنفيذ طلبات غير مرغوب فيها.
ويثير ذلك تحديات خاصة عند استخدام الذكاء الاصطناعي في المجالات التي تتطلب دقة عالية، إذ لا تكفي الإجابة المقنعة لغويا وحدها للتحقق من صحة المعلومات التي يقدمها النموذج، ما يجعل مراجعة المخرجات والتحقق من مصادرها خطوة أساسية.
وفي ظل هذه التحديات، تركز أبحاث الذكاء الاصطناعي على تطوير نماذج أكثر استقرارا وأقل تأثرا بالتغييرات السطحية في صياغة الأوامر، مع تحسين قدرتها على فهم مقصد المستخدم والتعامل مع السياق بصورة أكثر اتساقا. كما يجري بحث عدد من الأساليب لتحسين موثوقية المخرجات، مع استمرار النقاش العلمي حول مدى فاعلية كل تقنية في الحد من الأخطاء والتباين بين الإجابات.