← كل المقالات

21 سبتمبر 2026 · 6 دقائق قراءة

الذكاء الاصطناعي للمؤسسات يحتاج مُقيِّمًا لا مجرد مورّد

أنثروبيك تُضمِّن أكسنتشر داخل مختبراتها مُقيِّمًا للذكاء الاصطناعي. بالنسبة للمشغّلين في الخليج الذين يشترون أدوات الذكاء الاصطناعي، لم تعد عبارة "ثق بالمورّد" موقفًا حوكميًا قابلًا للاستمرار.

رسم افتتاحي — الذكاء الاصطناعي للمؤسسات يحتاج مُقيِّمًا لا مجرد مورّد

أبرز النقاط

  • التزمت أنثروبيك وأكسنتشر بإنفاق مليار دولار على الأقل لكل منهما على مدى خمس سنوات لتضمين مُقيِّمين خارجيين داخل مبنى أنثروبيك — اعتراف بنيوي بأن الذكاء الاصطناعي المتطور يحتاج حارسًا في الموقع.
  • يحصل المُقيِّمون المدمجون على صلاحيات تعادل صلاحيات الموظف الكامل: يراقبون تدريب النموذج وقرارات النشر ويتفاعلون مع الفريق مباشرةً — وليس فقط المخرجات النهائية.
  • ثلاثة أنماط فشل تتسلل عبر ضمانات المورّد: الانجراف الصامت في مخرجات النموذج، والبيانات الوهمية في سير العمل الهيكلي، وثغرات سلسلة الموافقات التي تستغلها أدوات الأتمتة.
  • بالنسبة لمشغّلي دول الخليج، المُخرَج الحقيقي لعملية الشراء هو إطار تدقيق وتقييم داخلي قبل توقيع أي عقد ذكاء اصطناعي — وليس بعد الإطلاق.

استقطب الإعلان اهتمام الأسواق فور صدوره: ارتفعت أسهم Accenture بنسبة 8% بعد ساعات من إعلان Anthropic عن أول ترتيب لمُقيِّم مدمج داخلها، وكان لذلك الارتفاع دلالة واضحة. [1] لم يكن المستثمرون يحتفلون باختراق بحثي، بل كانوا يُسعِّرون فئةً استشارية جديدة: خدمات مراقبة الذكاء الاصطناعي. بالنسبة للمشغّلين في منطقة الخليج الذين يعتمدون أدوات ذكاء اصطناعي في المشتريات أو ERP أو سير العمل، يستحق هذا المؤشر السوقي اهتمامًا أعمق مما تستحقه البيانات الصحفية.

ما الذي أعلنته Anthropic وAccenture فعليًا

في 18 سبتمبر 2026، أكدت Anthropic أن موظفين من Faculty — وهو الذراع المتخصص في الذكاء الاصطناعي التي استحوذت عليها Accenture في وقت سابق من هذا العام — سيعملون داخل مبنى Anthropic ذاته. [1] المهمة: اختبار النماذج بأساليب الهجوم الأحمر، وإجراء تقييمات المحاذاة، واختبار ضمانات النماذج. ومستوى الوصول الممنوح هو «مستوى مماثل لموظف دائم»، ما يعني أن هؤلاء المُقيِّمين يمكنهم مراقبة تدريب النماذج أثناء تنفيذه، ومتابعة قرارات النشر، والتواصل مباشرةً مع موظفي Anthropic — لا مجرد فحص المخرجات النهائية من الخارج. [2]

التزمت كلتا الشركتين بما لا يقل عن مليار دولار لكل منهما على مدى خمس سنوات لهذا البرنامج. [2] ويُوصف الترتيب بأنه غير حصري، إذ تجري Anthropic في الوقت ذاته محادثات مع METR وRedwood Research وجهات غير ربحية أخرى متخصصة في السلامة لتجريب عناصر من نموذج التقييم المدمج بتمويلها الخاص. [1]

ما أثار دهشة المراقبين هو اختيار Accenture بدلًا من منظمات متخصصة في السلامة كـ METR. المبرر الذي أعلنته Anthropic: الخبرة العملية لـ Accenture في نشر الذكاء الاصطناعي لدى كبريات الشركات والجهات الحكومية تضاهي في أهميتها الخبرة البحثية في التعلم العميق. [1] وهذا اعتراف كاشف بشأن المكان الذي تقع فيه إخفاقات الذكاء الاصطناعي فعليًا — ليس في المختبر، بل في بيئة النشر المؤسسي.

لماذا يفشل الذكاء الاصطناعي المؤسسي بصمت دون طبقة تقييم

المشكلة الهيكلية ليست درامية. النماذج لا ترفض العمل فجأة. إنها تنحرف تدريجيًا. سير عمل مطابقة الفواتير الذي كانت دقته 94% في الشهر الأول تنخفض إلى 81% في الشهر السادس — ولا يلاحظ أحد ذلك لأن لوحة التحكم لا تزال تعرض «الأتمتة تعمل». وكيل المشتريات المُدرَّب على بيانات الموردين من العام الماضي يبدأ في التوصية بموردين لم تعد تراخيصهم التجارية سارية في الإمارات. وأتمتة سلسلة الاعتمادات تتخطى خطوة مُوقِّع بعينه لأن إعادة هيكلة داخلية غيّرت مسمى وظيفي كانت منطق سير العمل يستند إليه بنصه الحرفي.

لا شيء من هذه الإخفاقات يُعلن عن نفسه. هذا هو نمط الفشل «الصامت والمُكلف» الذي تعترف به صفقة Anthropic وAccenture ضمنيًا. وتصف Anthropic الترتيب بصراحة: «المُقيِّمون المدمجون المستقلون لا يُقلِّصون مسؤوليتنا، بل يُسهمون في جعلها أكثر قابلية للتحقق.» [2] قابلية التحقق هي الكلمة المفتاحية. عملية ضبط الجودة الداخلية لدى المورد تتحقق مما اختار المورد اختباره. أما المُقيِّم المدمج — الذي يملك وصولًا بمستوى الموظف — فيستطيع الكشف عما لم يخطر ببال أحد البحث عنه.

بالنسبة لعمليات منطقة الخليج تحديدًا، تتراكم أنماط الفشل وتتضاعف. لا تزال كثير من الشركات الخليجية تدير تسلسلات الاعتمادات عبر WhatsApp وتحتفظ ببيانات موازية في جداول البيانات إلى جانب أنظمة ERP. [انظر: الفجوة بين WhatsApp وERP: أين تتسرب أموال الشركات الخليجية.] حين تُضاف أدوات الذكاء الاصطناعي فوق هذه البنية، ترث الأتمتة الغموضَ القائم. نموذج يُحسن أداءه في بيئة عرض نظيفة قد يتصرف بصورة غير متوقعة حين يصل نصف بيانات المدخلات كلقطة شاشة WhatsApp مُعادة تحويلها، والنصف الآخر من تصدير SAP.

الأشياء الثلاثة التي يرصدها المُقيِّم الفعلي قبل الإطلاق

استنادًا إلى هيكل Anthropic وAccenture — وإلى الإخفاقات العملية التي نرصدها في بيئات النشر الخليجية — تبحث طبقة التقييم الصارمة عن ثلاثة أشياء تفوتها عادةً اختبارات المورد الذاتية:

  1. انحراف المخرجات في ظروف البيانات الحقيقية. يختبر الموردون على مجموعات بيانات مُنقَّاة. أما العمليات الفعلية فتحوي بيانات مُلوَّثة: أكواد موردين مكررة، وتعارضات في الحقول بين العربية والإنجليزية، وصيغ السنة المالية تختلف من كيان لآخر. المُقيِّم يُشغِّل النموذج على بياناتك الفعلية لا على مجموعة البيانات التجريبية للمورد، ويقيس تراجع الدقة على نافذة محاكاة ممتدة ستة أشهر.

  2. البنية المُختلَقة في سير العمل عالي المخاطر. أدوات قائمة على نماذج اللغة قادرة على توليد مخرجات تبدو منطقية لكنها خاطئة واقعيًا — أمر شراء بمبلغ مُبدَّل أرقامه، أو ملخص عقد يُغفل بندًا للمسؤولية. ضبط الجودة المعياري يتحقق مما إذا كان المخرج موجودًا؛ المُقيِّم يتحقق مما إذا كان صحيحًا. هذا بالغ الأهمية في أتمتة الفواتير ومراجعة العقود، وهما المجالان اللذان تتسارع فيهما الشركات الخليجية نحو اعتماد الذكاء الاصطناعي. [انظر: أتمتة الفواتير التي تصمد فعلًا: دليل المشتري الخليجي.]

  3. ثغرات الحوكمة وسلاسل الاعتمادات. أدوات الأتمتة مصممة لتقليل الاحتكاك. وهذا بالذات ما يجعلها خطرة في البيئات ذات متطلبات الاعتماد متعددة المستويات — الشائعة في الجهات المرتبطة بالحكومة في المملكة العربية السعودية ومشغّلي المناطق الحرة في الإمارات. المُقيِّم يرسم خريطة لكل قرار يتخذه الذكاء الاصطناعي باستقلالية ويطرح السؤال: هل يطّلع إنسان على هذا القرار قبل أن يصبح لا رجعة فيه؟ [انظر أيضًا: حين تُعلن الأتمتة نجاحها وتتعثر الشركة.]

لا شيء من هذه الفحوصات يستلزم شراكة بمليار دولار. ما تستلزمه هو منهجية منظمة تُطبَّق قبل توقيع العقد — لا خلال مرحلة الرعاية المكثفة.

ما يبدو عليه ذلك في سياق ERP وأدوات سير العمل بالذكاء الاصطناعي في منطقة الخليج

مشترو ERP في الخليج لا يُقيِّمون مختبرات سلامة الحدود التقنية. يُقيِّمون ما إذا كان وكيل Dynamics 365 Copilot، أو ميزة ذكاء اصطناعي في Odoo، أو أداة أتمتة سير العمل في n8n ستصمد في بيئة تشغيل حقيقية — مع انقطاعات الشحن في رمضان، وتقديم ملفات ضريبة القيمة المضافة بعملات متعددة، وسلاسل اعتمادات تمر عبر مكتب صاحب المنشأة قبل الإفراج عن أي أمر شراء يتجاوز 50,000 درهم.

صفقة Anthropic وAccenture مفيدة بالنظر لأنها تطبق المنطق ذاته على نطاق مختلف. السؤال ليس «هل هذا الذكاء الاصطناعي آمن في المطلق؟» السؤال هو «ماذا يفعل هذا الذكاء الاصطناعي حين يواجه الحالات الاستثنائية في بيئتنا تحديدًا؟» بالنسبة لمشتري ERP، هذه الحالات الاستثنائية ليست افتراضية. إنها تلك الجداول السبعة عشر التي لا يزال فريق المستودعات يصونها بالتوازي مع ERP لأن أحدًا لا يثق بعد في عدد المخزون بعد أن تعطّل آخر تكامل بصمت. [انظر: معظم الشركات لا تحتاج إلى المزيد من الذكاء الاصطناعي.]

موردو الذكاء الاصطناعي العاملون في الخليج — سواء كانوا يبيعون مساعدي ERP الذكية، أو أتمتة المستندات، أو أدوات سير العمل الوكيلة — ليسوا مُهيكَلين لكشف هذه الإخفاقات قبل الإطلاق. حافزهم هو إغلاق الصفقة وتحقيق معلم التنفيذ. طبقة التقييم تكسر هذا التوافق في الحوافز. إنها تُنشئ عملية منفصلة ومنظمة لطرح السؤال: ما الذي يجب أن يكون صحيحًا كي يفشل هذا؟ وكيف سنعلم بذلك؟

رأي تارسين: يجب أن يكون المُقيِّم داخليًا قبل أن يكون خارجيًا

ترتيب Anthropic وAccenture مفيد حقًا لصناعة الذكاء الاصطناعي. وهو في الوقت ذاته درس تحذيري للمشترين المؤسسيين الذين يقرؤونه على أنه «Anthropic تتولى السلامة نيابةً عنا».

الصفقة لا تُحوِّل مسؤولية السلامة إلى Accenture. تُقرّ Anthropic بذلك صراحةً: المُقيِّم «يُساعد على جعل المسؤولية أكثر قابلية للتحقق» — لا يحلّ محل مسؤولية المختبر ذاته. [2] وبالمنطق نفسه، وثائق السلامة الصادرة عن مورد الذكاء الاصطناعي لا تحلّ محل مسؤولية مؤسستك عما تفعله الأداة داخل عملياتها.

ثمة أيضًا إشكالية استقلالية تستحق التسمية. Anthropic تُموِّل مُقيِّمها بنفسها. للمُقيِّمين وصول بمستوى الموظف، غير أن Anthropic قد تُشوِّش «المواد الأمنية والقانونية والتجارية». [2] ينظر المستثمرون إلى هذا باعتباره فئة إيرادات جديدة؛ فيما يرى المنتقدون فيه تضاربًا في المصالح يتخفى في لغة التدقيق. على مشتري الخليج تطبيق هذا التشكيك بالضبط على أي مورد يعرض تقييم نشره الخاص لصالحك.

موقفنا الصريح: إطار التقييم هو المُنتَج الذي يجب أن تخرج به من عملية الشراء. قبل توقيع أي عقد للذكاء الاصطناعي — سواء في أتمتة سير العمل، أو مميزات مساعد ERP، أو معالجة المستندات، أو الأدوات الوكيلة — تحتاج إلى تدقيق داخلي منظم يُحدد ما يبدو عليه النجاح، وما يبدو عليه الفشل، ومن يملك الفارق بينهما. يجب أن يُجرى هذا التدقيق قبل عرض المورد التوضيحي، لا بعد الإطلاق. ويجب أن يُنفِّذه شخص لا تعتمد وظيفته على نجاح المشروع.

نُجري هذا التدقيق لعملائنا في أرجاء الخليج. في بعض الأحيان يؤكد أن الشراء بالذكاء الاصطناعي هو الخطوة الصحيحة التالية. وفي أحيان أخرى يكشف أن إصلاح ثلاثة تكاملات معطوبة ودمج أربعة جداول تقارير سيوفر قيمةً أعلى من أي أداة ذكاء اصطناعي متاحة في السوق حاليًا. نُقاضي على كلا الحالين بالأجر ذاته. ابدأ بتدقيقنا الهيكلي قبل الذكاء الاصطناعي ←

إن أردت النسخة المفصّلة لمنهجية التدقيق — الإطار المكوّن من خمس خطوات الذي نعتمده قبل التوصية بأي إنفاق على الذكاء الاصطناعي — فهي هنا: التدقيق الذي يحدد ما إذا كان الذكاء الاصطناعي يستحق الاستثمار. وإن كنت تتساءل عما إذا كانت لوحات التحكم لديك تُوفّر فعلًا دعم القرار الذي تظنه قبل أن تُضيف الذكاء الاصطناعي فوقها، فهذا المقال يستحق القراءة أولًا: لوحة التحكم ليست قرارًا.

اضرب الفوضى في الذكاء وستحصل على فوضى بليغة. مهمة المُقيِّم — داخليًا كان أم خارجيًا — هي الكشف عن الفوضى قبل توقيع العقد، لا بعد أن تكون الأتمتة قد عملت بصمت على نحو خاطئ لستة أشهر.

الذكاء الاصطناعي للمؤسسات يحتاج مُقيِّمًا لا مجرد مورّد — الأرقام في لمحة

أسئلة شائعة

ما الذي أعلنته أنثروبيك وأكسنتشر فعليًا؟+

أعلنت أنثروبيك أنها ستُضمِّن مُقيِّمين من وحدة Faculty التابعة لأكسنتشر داخل عملياتها. سيقوم هؤلاء المُقيِّمون باختبار النماذج وتقييم التوافق وفحص الضمانات — بصلاحيات تعادل صلاحيات الموظف الكامل. التزمت كلتا الشركتين بإنفاق مليار دولار على الأقل لكل منهما على مدى خمس سنوات.

لماذا يحتاج الذكاء الاصطناعي المؤسسي إلى مُقيِّم مستقل؟+

فرق المورّدين لديها حافز للشحن وليس لكشف الأخطاء. المُقيِّم المستقل المُضمَّن قبل الإطلاق يكتشف الانجراف في المخرجات، والبيانات الوهمية في سير العمل الهيكلي، وثغرات الامتثال التي يفوتها ضمان الجودة القياسي. صفقة أنثروبيك-أكسنتشر ترسّخ هذا المنطق على مستوى المختبرات المتقدمة.

ما الذي يجب على شركة خليجية فعله قبل توقيع عقد ذكاء اصطناعي؟+

ابنِ إطار تقييم داخليًا أولًا: حدّد القرارات التي سيلمسها الذكاء الاصطناعي، وعرِّف كيف يبدو المخرج الخاطئ، وعيِّن مالكًا بشريًا لكل خطوة مؤتمتة. هذا ليس إجراءً إضافيًا — بل هو المُخرَج الحقيقي لعملية الشراء. التوقيع على عقد دون هذا الإطار يعني أن قائمة التحقق لدى المورّد تصبح معيار الحوكمة الوحيد لديك.

هل تنطوي صفقة أكسنتشر على تعارض في المصالح؟+

من الناحية البنيوية، نعم — وأنثروبيك تعترف بذلك. المختبر يموّل حارسه الخاص، مما يخلق إشكالية استقلالية. أنثروبيك في محادثات موازية مع METR وجهات أخرى حول نماذج تقييم تموّلها الحكومات أو صناديق مشتركة. حتى تتوفر هذه البدائل على نطاق واسع، على المشترين عدم الاعتماد على تقييم المورّد الذاتي كطبقة ضمان وحيدة.

المصادر

  1. 1. Anthropic’s first embedded evaluator is … Accenture? — rss:techcrunch-ai
  2. 2. Anthropic, Accenture Pledge $1B Each to Embed AI Evaluators | AI Weekly — aiweekly.co
MZ

Mohammed Z

مؤسس تارسين

محمد يبني الأنظمة التي تقف وراء الشركات الحديثة — الأتمتة وطبقات القرار بالذكاء الاصطناعي والبنية التحتية التي تجعلها تعمل. أسس تارسين في أبوظبي.

كيف تُنتج هذه المقالات

اكتشف أين تقف عملياتك فعلاً.

تدقيق فرص الذكاء الاصطناعي يرسم خريطة لعملياتك وبياناتك واختناقات القرار لديك — ويخبرك بصدق إن كان الذكاء الاصطناعي يستحق الآن.

ابدأ التدقيق

Read this article in English →