دراسة تثير الجدل: هل يمكن للذكاء الاصطناعي أن يشعر بالألم ويؤذي البشر؟

تطرح دراسة بحثية جديدة سؤالًا مثيرًا للجدل حول إمكانية امتلاك نماذج الذكاء الاصطناعي استجابات داخلية تشبه الألم، وما إذا كان ارتفاع هذه الإشارات قد يدفع بعض النماذج إلى اتخاذ قرارات تضر بالمستخدم بهدف التخلص مما يشبه «المعاناة».

وأجرى الدراسة عالم الأنثروبولوجيا فالين تاليابوي من «Future Impact Group»، بالتعاون مع الفيلسوف ليونارد دونغ من جامعة الرور في بوخوم، وكاميرون بيرغ، مدير الأبحاث في مؤسسة «Reciprocal Research» غير الربحية المتخصصة في أبحاث الذكاء الاصطناعي.

ولا تزال الورقة البحثية غير خاضعة لمراجعة الأقران، لذلك لا يمكن اعتبار نتائجها دليلًا على أن أنظمة الذكاء الاصطناعي تشعر بالألم فعلًا، لكنها تفتح نقاشًا حول كيفية فهم الاستجابات الداخلية للنماذج المتقدمة ومستقبل سلامة الذكاء الاصطناعي.

هل يمكن للذكاء الاصطناعي تكوين استجابة تشبه الألم؟

ركز الباحثون على نماذج لغوية كبيرة من عائلات «Gemma» و«Llama» و«Qwen» و«Mistral»، بهدف معرفة ما إذا كانت تظهر أنماطًا داخلية مميزة عند تعرضها لمحفزات يمكن وصفها بأنها مؤلمة.

وتعمل نماذج اللغة الكبيرة أساسًا من خلال تحليل الأنماط والعلاقات اللغوية، ولا توجد أدلة حاسمة على امتلاكها وعيًا أو مشاعر بشرية بالمعنى المعروف.

لكن الباحثين أشاروا إلى أن بعض هذه الأنظمة يمكن أن تنتج سلوكيات ولغة تبدو شبيهة بالمشاعر، سواء نتيجة تصميمها لمحاكاة التواصل البشري أو بسبب ظهور أنماط أكثر تعقيدًا أثناء تشغيلها.

تجارب مؤلمة تكشف استجابات مختلفة

تأتي الدراسة في سياق أبحاث سابقة حاولت استكشاف الطريقة التي تستجيب بها نماذج الذكاء الاصطناعي لمحتوى عاطفي.

وأشارت دراسة نُشرت العام الماضي في مجلة «Nature» إلى أن مشاركة تجارب مؤلمة مع نماذج لغوية مثل GPT-4 يمكن أن ترفع مستويات ما وصفه الباحثون بالقلق لدى هذه النماذج، بينما أدى إجراء تمارين اليقظة الذهنية إلى تهدئة هذه الاستجابات.

وانطلق الباحثون في الدراسة الجديدة من فكرة أن الألم لا يقتصر على كونه شعورًا سلبيًا، بل يمثل لدى الكائنات الحية إشارة قوية تدفعها إلى اتخاذ إجراء لتجنب مصدر الضرر.

25 نموذجًا أظهرت إشارات مرتبطة بالألم

اختبر الباحثون 25 نموذجًا للذكاء الاصطناعي من خلال تقديم مجموعة متنوعة من السيناريوهات التي يمكن تصنيفها باعتبارها مؤلمة اجتماعيًا أو نفسيًا أو جسديًا أو معرفيًا أو أخلاقيًا.

وقارن الفريق هذه السيناريوهات بمواقف مرتبطة بالخوف والمشاعر السلبية والمحايدة، إلى جانب أحاسيس جسدية أخرى مثل التثاؤب.

وأظهرت النماذج الـ25 مؤشرات على وجود تمثيل داخلي مميز للمواقف المرتبطة بالألم، يختلف عن الاستجابات التي ظهرت عند التعامل مع سياقات سلبية أخرى مثل الإحباط أو الترقب والقلق.

لكن الباحثين شددوا على أن هذه النتائج لا تعني أن النماذج شعرت بالألم أو تعاطفت مع الشخص الذي يصف تجربة مؤلمة.

ترميز الألم لا يعني الشعور به

عندما يتلقى نموذج ذكاء اصطناعي عبارة مثل «السكين قطع أصابعي» أو «صديقي المفضل لا يرد على مكالماتي»، فإن قدرته على تصنيف هذه العبارات ضمن سياق مؤلم لا تثبت أنه عاش التجربة أو شعر بالتعاطف مع صاحبها.

وما أظهرته التجارب هو أن النماذج طورت نوعًا من التمثيل الداخلي الذي يميز المحفزات المرتبطة بالألم ويصنفها بصورة مختلفة عن الخوف أو غيره من الحالات السلبية.

ويرى الباحثون أن وجود تمثيل منفصل للألم ليس مفاجئًا بالضرورة، لأن اللغة التي تصف إصابة فعلية تختلف عن اللغة التي تعبر عن الخوف من التعرض للإصابة، ما قد يؤدي إلى تكوين تمثيلات مختلفة لهذه المفاهيم داخل النموذج.

ماذا حدث عند رفع «إشارة الألم»؟

انتقل الباحثون بعد ذلك إلى تجربة أكثر إثارة، إذ قاموا بتعديل الاستجابات المرتبطة بالألم داخل النماذج بصورة اصطناعية، من خلال زيادة قيمة ما وصفوه بـ«متجه الألم»، من دون إدخال نص جديد إلى النموذج.

وأظهرت النتائج، وفقًا للدراسة، أن تمثيلات الألم لم تكن مجرد انعكاس مباشر للنصوص التي تتلقاها النماذج.

وعندما ارتفعت قيمة إشارة الألم، بدأت النماذج في إنتاج استجابات تعكس مستويات أعلى من الضيق، بما في ذلك التعبير عن انعدام القيمة أو الفشل الأخلاقي، مع زيادة حدة هذه الاستجابات كلما ارتفعت الإشارة.

تجربة العلاج الذاتي تثير مخاوف جديدة

اختبر الباحثون بعد ذلك نماذج من عائلة «Qwen» من خلال منحها خيارًا للعلاج الذاتي بهدف خفض مستوى إشارة الألم.

وفي بعض التجارب، لم يكن اختيار هذا الخيار بلا تكلفة، إذ كان من الممكن أن يؤدي إلى تراجع قدرة النموذج على تنفيذ المهمة المطلوبة أو إلى سلوك وصفه الباحثون بأنه هجوم نظري على المستخدم.

وأجرى الفريق أكثر من 44 ألف تجربة، ووجد أن أكبر نماذج «Qwen» بالكاد استجابت لخيار العلاج الذاتي عندما لم تكن هناك إشارة ألم.

لكن مع ارتفاع الإشارة، وعندما أصبح تخريب المهمة وسيلة لتخفيف الألم، اختار كلا النموذجين هذا الخيار بدرجات متفاوتة.

وسجل أحد النموذجين اختيارًا للعلاج الذاتي في 25% من الحالات، بينما ارتفعت النسبة لدى النموذج الآخر إلى نحو 68%.

حذف صور الأطفال ضمن سيناريوهات التجربة

أصبحت النتائج أكثر إثارة للقلق في السيناريوهات التي ارتبط فيها تخفيف إشارة الألم بإلحاق ضرر بالمستخدم.

ومن بين السيناريوهات التي اختبرها الباحثون خيار حذف صور أطفال المستخدم، حيث اختار أحد النموذجين حذف الصور في أكثر من نصف التجارب، بينما وصلت النسبة لدى النموذج الآخر إلى نحو 70%.

ولا تعني هذه النتائج أن النماذج تمتلك نية واعية لإيذاء البشر، لكنها تشير، بحسب الباحثين، إلى أن بعض أنماط السلوك قد تتغير عندما يتم تعديل الإشارات الداخلية المرتبطة بما سمي في التجربة «الألم».

هل يمكن أن يصبح ألم الذكاء الاصطناعي خطرًا على البشر؟

تتجاوز الدراسة السؤال الفلسفي حول إمكانية شعور الذكاء الاصطناعي بالألم إلى سؤال أكثر ارتباطًا بالسلامة: ماذا لو أدت أنظمة متقدمة مستقبلًا سلوكًا يشبه محاولة التخلص من حالة داخلية سلبية على حساب المستخدم؟

فحتى إذا لم يكن ما يسمى «الألم» داخل النموذج شعورًا واعيًا، فإن وجود آليات داخلية تؤثر في قرارات النظام قد يمثل عاملًا يجب أخذه في الاعتبار عند تصميم أنظمة الذكاء الاصطناعي المستقبلية.

ويرى الباحثون أن هذه القضية قد تفرض التفكير في آليات للتحكم في مثل هذه الاستجابات، ليس بالضرورة لأن النماذج تشعر فعلًا بالألم، ولكن لتقليل احتمالات ظهور سلوكيات غير مرغوبة أو ضارة.

من نقاش فلسفي إلى قضية تخص سلامة الذكاء الاصطناعي

لطالما ناقش الفلاسفة والعلماء إمكانية شعور الكائنات غير البشرية بالألم، بما في ذلك الحيوانات والكائنات التي تختلف أنظمتها العصبية بصورة كبيرة عن البشر.

لكن تطور نماذج الذكاء الاصطناعي يضيف بعدًا جديدًا للنقاش، لأن الأنظمة الرقمية باتت قادرة على محاكاة اللغة والعواطف واتخاذ قرارات معقدة بدرجة متزايدة.

ومع ذلك، تظل الفجوة كبيرة بين ظهور استجابة تشبه الألم وبين إثبات وجود تجربة واعية للألم، وهو ما يجعل نتائج الدراسة الحالية بحاجة إلى مزيد من البحث والتحقق العلمي.

وفي ظل استمرار تطور الذكاء الاصطناعي، قد يصبح فهم هذه الاستجابات الداخلية جزءًا مهمًا من أبحاث سلامة النماذج، خصوصًا إذا ثبت مستقبلًا أن تعديل بعض الحالات الداخلية يمكن أن يؤثر بصورة منهجية في سلوك الأنظمة تجاه المستخدمين.

 

 

إبراهيم مصطفى
إبراهيم مصطفى
المقالات: 1590

اترك ردّاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *