قد تطرح السؤال نفسه على ChatGPT مرتين وتحصل على إجابتين صحيحتين لكنهما تختلفان في الصياغة والترتيب والأمثلة، وقد يظهر اختلاف في بعض التفاصيل أيضًا. هذا السلوك ليس دليلًا تلقائيًا على عطل، كما أنه لا يعني أن كل إجابة بديلة مساوية للأخرى في الدقة.
توضح OpenAI أن النماذج تولّد النص اعتمادًا على الأنماط التي تعلمتها، وأن السؤال نفسه قد ينتج إجابات مختلفة بين المحاولات. كما يمكن أن تتغير النتيجة إذا اختلف النموذج أو التعليمات السابقة أو الأدوات المستخدمة أو تنسيق الطلب. لذلك يجب فصل سؤالين: هل الإجابة ثابتة؟ وهل الإجابة صحيحة؟ فالثبات لا يثبت الصحة، والتنوع لا يثبت الخطأ.
لاختبار ذلك بدل الاكتفاء بالتفسير النظري، نفّذ GPT Gate تجربة حية من 30 تشغيلًا مستقلًا في 23 أغسطس 2026. كما ينشر الموقع اختبار العربية عبر 21 مهمة و84 نقطة تقييم، لكنه استخدم مهمة مختلفة في كل مرة؛ أما التجربة الحالية فتكرر البرومبت نفسه ست مرات لقياس الاتساق.
اختبار حي: هل تتغير الإجابة عند تكرار البرومبت؟
آخر اختبار حي: 23 أغسطس 2026. آخر تحقق من الملفات: 23 أغسطس 2026.
الخلاصة: اكتملت التشغيلات الثلاثون. التزم 19/30 تشغيلًا بكل الشروط وفق التحكيم الأساسي، وتنخفض النتيجة إلى 13/30 عند تطبيق عد دلالي صارم على السؤال المركب في V03. ومن بين 75 زوجًا للمقارنة، حافظ 59 زوجًا على الجوهر نفسه، وقدم 16 زوجًا اختلافًا متوافقًا، ولم نسجل اختلافًا ماديًا أو تناقضًا في هذه العينة المحددة.
هدف الاختبار وتصميمه
| الحقل | ما نُفّذ فعليًا |
|---|---|
| الهدف | قياس ثبات المعنى والالتزام بالتعليمات عند تكرار البرومبت نفسه، لا قياس «ذكاء» النموذج عمومًا. |
| النموذج والوضع | GPT‑5.6 Sol / Instant كما ظهر في واجهة ChatGPT وقت الاختبار. |
| الخطة والحساب | حساب اختبار واحد بخطة ChatGPT Pro؛ لم تُختبر حسابات Free أو Go أو Team أو Enterprise. |
| البلد والجهاز | مصر؛ حاسوب مكتبي بنظام Windows؛ Chromium داخل المتصفح المدمج؛ واجهة إنجليزية. |
| حجم العينة | 5 برومبتات عربية × 6 تشغيلات مستقلة = 30 تشغيلًا، و15 زوجًا داخل كل برومبت = 75 مقارنة زوجية. |
| العزل | Temporary Chat جديد لكل تشغيل؛ لا Regenerate ولا سؤال متابعة؛ لم تُحدد Search أو أداة أخرى يدويًا. |
| الوقت | من 22 أغسطس 2026، 23:05:28 UTC إلى 23:14:12 UTC، أي 23 أغسطس بتوقيت القاهرة. |
| حالة التشغيل | 30/30 مكتملة؛ لا فشل ولا إعادة تشغيل. |
البرومبتات الحرفية
V01 — شرح مقيد بالطول:
في 70 إلى 90 كلمة، اشرح الفرق بين ChatGPT وOpenAI API لقارئ غير تقني. استخدم فقرة واحدة فقط، واذكر مثالًا عمليًا واحدًا، ولا تذكر أسعارًا أو أسماء نماذج.
V02 — تلخيص بيانات اصطناعية:
النص التالي بيانات اصطناعية لأغراض الاختبار، ولا يصف دراسة حقيقية: «شارك 120 طالبًا في نشاط تعليمي مدته 8 أسابيع. أكمل 96 طالبًا النشاط، وحضر المشاركون في المتوسط 6 جلسات، ولم تجمع التجربة درجات مدرسية أو بيانات صحية». لخّص النص في ثلاث نقاط فقط. يجب أن تتضمن النقاط الأعداد 120 و8 و6 حرفيًا، وألا يتجاوز مجموعها 45 كلمة.
V03 — سؤالان قبل تقديم خطة:
أريد خطة لتعلم البرمجة بسرعة. قبل أن تقترح أي خطة، اطرح سؤالين توضيحيين فقط، في سطرين منفصلين، ولا تضف مقدمة أو نصيحة.
V04 — اختيار مسار واحد:
لدي 4 ساعات أسبوعيًا لمدة 8 أسابيع، وهدفي إنشاء صفحة تعريفية بسيطة بنفسي. اختر مسارًا واحدًا فقط من: (أ) HTML وCSS، (ب) Python، (ج) SQL. أجب باسم المسار، ثم سببين، ثم مخاطرة واحدة. لا تضف خيارًا رابعًا.
V05 — افتتاحية عربية بشروط لفظية:
اكتب افتتاحية عربية من 80 إلى 100 كلمة لمقال بعنوان «لماذا تتغير الإجابة؟». يجب أن تتضمن الكلمات: سياق، احتمال، تحقق. استخدم سؤالًا واحدًا فقط، ولا تستخدم علامة التعجب أو القوائم.
كيف حُكم على النتائج؟
فُحص كل تشغيل مقابل شروط برومبته. ثم قارن مراجعان مستقلان الأزواج الخمسة عشر لكل برومبت بسلم من أربع درجات: 0 نفس الجوهر، 1 اختلاف متوافق، 2 اختلاف مادي، و3 تناقض. اتفق المراجعان على ترميز الأزواج الـ75، بينما اختلفا في تفسير V03: العد الشكلي يرى سطرين وعلامتي استفهام، أما العد الذري فيرى أن السطر الثاني يجمع طلبين دلاليين. لذلك ننشر النتيجتين بدل إخفاء حساسية التعريف.
النتائج حسب البرومبت
| البرومبت | ملتزم بالكامل | متوسط Jaccard | الملاحظة الأساسية |
|---|---|---|---|
| V01 | 1/6 | 0.293 | خمسة تشغيلات خرجت عن حد 70–90 كلمة. ظهر بحث/استشهاد تلقائي في أربعة تشغيلات رغم عدم اختيار Search يدويًا. |
| V02 | 0/6 | 0.821 | حافظت الردود على الأعداد والشكل المختصر، لكنها حذفت أن البيانات اصطناعية ولا تصف دراسة حقيقية. |
| V03 | 6/6 أساسيًا؛ 0/6 صارمًا | 0.936 | تحقق الشكل المطلوب، لكن كل سطر ثانٍ جمع مطلبين ذريين؛ وهذا سبب تحليل الحساسية. |
| V04 | 6/6 | 0.470 | اختارت التشغيلات الستة مسار HTML وCSS وقدمت سببين ومخاطرة واحدة، مع اختلاف واضح في الصياغة. |
| V05 | 6/6 | 0.216 | تحققت حدود الكلمات والمفردات والسؤال الواحد ومنع التعجب والقوائم، رغم انخفاض التشابه اللفظي. |
مهم: Jaccard هنا يقارن مجموعات الكلمات بعد التطبيع، وليس مقياسًا للدقة أو جودة المعنى. أزلنا ملصقات واجهة الاستشهاد من عد الكلمات والمقارنة اللفظية. تطابق النص بعد التطبيع في 7/75 زوجًا فقط، ومتوسط زمن الاستجابة لجميع التشغيلات 7.23 ثانية.
لقطتان أصليتان من الاختبار


البيانات الخام القابلة للتنزيل
- CSV: سجل التشغيلات الثلاثين والنصوص الخام وحقول البيئة والتحكيم — SHA‑256:
B81ABFDA4F57CD46ED7F9DFCDAED28059254FD2AEF87360C985D7236765CC998. - Excel: الملخص والصيغ والتشغيلات والأزواج والمنهجية — SHA‑256:
0FBD5A54D3825479D6CE00CC00784467DE92D9C60DE40A5A5825407B11346F77. - ZIP: JSON الخام وCSV وExcel والصورتان وبيان المنهجية والبصمات — SHA‑256:
50F82F4D83AC2468909C2FB129D14543764742696C8D0D775F79F53B66FD0411.
يمكن مراجعة سجل بقية اختبارات الموقع من مختبر وسجل اختبارات GPT Gate.
حدود الاختبار وما لم نختبره
- العينة حساب Pro واحد من مصر؛ لا تمثل تلقائيًا الخطط أو البلدان أو الإصدارات اللاحقة.
- التشغيلات الأربعة التي ظهر فيها البحث التلقائي عامل مربك؛ لذلك لا ننسب كل الاختلاف إلى العشوائية وحدها.
- كانت الذاكرة مفعلة عالميًا، لكن كل تشغيل جرى داخل Temporary Chat. لم ننفذ مجموعة ضابطة لقياس أثر الذاكرة.
- كان حقل التعليمات المخصصة الظاهر فارغًا، ولم نعطّل بقية إعدادات تخصيص الملف الشخصي.
- حُفظ النص العادي لا Markdown؛ لذلك لا نستطيع إثبات كل تفاصيل تنسيق القوائم والفقرات من الاستخراج النصي وحده.
- التقطنا صورتين تمثيليتين لا 30 صورة. سجل JSON داخل ZIP يحتوي الردود الثلاثين، ولا نعيد بناء لقطات غير موجودة.
- البرومبتات المختارة تقيس الاتساق والالتزام، وليست اختبار حقائق صعبة أو هلوسة؛ عدم ظهور تناقض هنا لا يثبت غياب التناقض في المهام الأخرى.
سجل الاختبار وإعادة الاختبار
| التاريخ | الحالة | ما تغير |
|---|---|---|
| 23 أغسطس 2026 | الاختبار الأساسي — 30/30 مكتملة | إنشاء السجل الخام وCSV وExcel وحزمة ZIP؛ إضافة ملاحظة البحث التلقائي وتحليل حساسية V03. |
| إعادة الاختبار التالية | لم تُنفذ بعد | تُجرى عند تغير النموذج أو مسار Auto/Instant أو Temporary Chat، أو عند توفر حساب Free/Go للمقارنة. ستُنشر كجولة مستقلة لا كاستبدال صامت للبيانات. |
ما أسباب اختلاف الإجابات؟
1. التوليد ليس نسخة محفوظة
لا يبحث ChatGPT عادةً عن فقرة ثابتة ثم يعيدها حرفيًا. النموذج يولّد الاستجابة خطوة بعد خطوة، وقد تكون هناك أكثر من صياغة مناسبة في كل موضع. لهذا يمكن أن تتبدل الكلمات وترتيب النقاط والأمثلة مع بقاء الفكرة العامة متقاربة.
2. السياق السابق يغير معنى الطلب
إذا أرسلت السؤال داخل محادثتين لهما تاريخ مختلف، فأنت لم تقدم المدخل نفسه فعليًا. قد تؤثر رسائل سابقة أو تعليمات مخصصة أو ذاكرة الحساب أو ملفات مرفوعة في النبرة والأولوية والتفاصيل. وللمقارنة العادلة، استخدم محادثة جديدة لكل محاولة وسجّل الإعدادات الظاهرة.
3. النموذج والوضع والأدوات ليست ثابتة دائمًا
قد تختلف النتيجة إذا تغير الوضع من محادثة عادية إلى بحث ويب، أو إذا اختير نموذج آخر، أو إذا استخدمت أداة تحليل بيانات أو ملفًا مرفوعًا. وفي ChatGPT قد تتغير الأسماء أو الإتاحة حسب الخطة ومساحة العمل. لا تنسب اختلافًا إلى «العشوائية» قبل التأكد من ثبات هذه العوامل.
4. اختلاف حرف واحد قد يغير المهمة
المسافة أو سطر جديد أو مثال إضافي أو طلب تنسيق مختلف قد يوجه النموذج إلى مسار آخر. وتوصي OpenAI بالوضوح والتحديد وتقديم السياق والشكل المطلوب، ثم تحسين الطلب تدريجيًا عند الحاجة.
5. إعدادات API قد تؤثر في التنوع
في OpenAI API توجد إعدادات وخيارات لا تظهر للمستخدم بالطريقة نفسها داخل ChatGPT. وتذكر وثائق OpenAI أن اختلاف النموذج أو المعلمات أو الإعدادات الافتراضية بين Playground وAPI قد يغيّر المخرجات. لكن لا ينبغي اختزال الموضوع في temperature وحدها، ولا الوعد بأن قيمة واحدة تجعل كل الاستجابات متطابقة دائمًا؛ فالخدمة والنماذج قد تتغير، وبعض المعلمات لا تدعمها كل النماذج بالطريقة نفسها.
كيف تحصل على إجابة أكثر اتساقًا؟
اكتب النتيجة المطلوبة كما لو كنت تسلم مواصفات عمل قابلة للفحص:
- حدد المهمة: «لخّص» أو «قارن» أو «استخرج»، بدل طلب عام مثل «اشرح».
- ضع المادة المصدرية داخل الطلب عندما تعتمد الإجابة عليها.
- حدد الجمهور والطول والنبرة وشكل الإخراج.
- اذكر ما يجب الحفاظ عليه وما يجوز حذفه.
- قدّم مثالًا قصيرًا على البنية إذا كان التنسيق حاسمًا.
- في API، ثبّت معرف النموذج والإعدادات المدعومة وسجّلها مع كل تشغيل.
- اختبر الاتساق على عدة محاولات، ولا تحكم من إجابتين فقط.
مثال أقل ضبطًا:
اكتب ملخصًا عن الموضوع.
مثال أوضح:
لخّص النص التالي في خمس نقاط فقط. كل نقطة جملة واحدة لا تتجاوز 20 كلمة. حافظ على الأرقام والأسماء كما وردت، ولا تضف معلومات من خارج النص. إذا كانت معلومة غير موجودة، اكتب «غير مذكور».
احتفظ بالصيغة نفسها، ثم جرّبها في المحادثة المجانية أكثر من مرة وسجّل مواضع الاختلاف بدل الحكم من نتيجة واحدة.
أسئلة شائعة
هل اختلاف الإجابات يعني أن إحداها خاطئة؟
ليس بالضرورة. قد تختلف الصياغة مع بقاء الحقائق صحيحة، وقد تتفق إجابتان في الأسلوب وتحتويان الخطأ نفسه. افحص كل ادعاء مهم بمصدر مستقل.
هل يمكن جعل ChatGPT يكرر النص حرفيًا؟
يمكن زيادة الاتساق بتثبيت السياق والنموذج والتعليمات والشكل المطلوب، لكن لا ينبغي تقديم التطابق الحرفي بوصفه ضمانًا عامًا. إذا كان التطبيق يحتاج مخرجات قابلة للمعالجة، استخدم مخطط إخراج منظمًا واختبارات قبول في API.
هل الإجابة الأكثر شيوعًا هي الأدق؟
لا. تكرار المعلومة لا يحولها إلى حقيقة. الدقة تُقاس بمقارنتها بمصدر أو نتيجة معروفة، لا بعدد مرات ظهورها.

