الترميز الطبي المعزز بالذكاء الاصطناعي: اقتراحات بقيمة 7,258 دولاراً

تواجه المستشفيات نقصاً في الكوادر، مما يدفع نحو حلول الذكاء الاصطناعي في الترميز الطبي. اقتراحات بدلاً من الأتمتة الكاملة لتجنب خسائر مالية تصل لـ $7,258.
مقدمة تحليلية
كل خطأ برمجي في الترميز السريري بالمستشفيات له قيمة دولارية مباشرة قابلة للحساب. وفقاً لنموذج التمويل القائم على النشاط، بلغ السعر الوطني الفعال (NEP) للعام 2025-26 ما يقدر بـ $7,258 لكل NWAU(25)، وهي زيادة بنسبة 5.9% وتعتبر الأكبر منذ بدء تطبيق نظام التمويل الوطني ABF. لإعطاء سياق، تبلغ تكلفة استئصال اللوزتين 0.7421 NWAU، أي حوالي $5,386، بينما تصل تكلفة استبدال مفصل الورك ذي التعقيد البسيط إلى 4.0251 NWAU، أي ما يقارب $29,214. أي إغفال لتشخيص إضافي يغير مستوى التعقيد يعني تحريك خمسة أرقام في فاتورة حلقة علاج واحدة.
هذا الواقع هو ما يدفع رؤساء تقنية المعلومات في القطاع الصحي للبحث عن تطبيقات الذكاء الاصطناعي القادرة على تحقيق عائد استثمار ملموس في هذا المجال. الإجابة الواضحة: بناء محرك اقتراحات، لا محرك ترميز كامل. المشكلة الأساسية تكمن في القدرة على التوسع، لا في كفاءة المبرمجين. ارتفعت حالات خروج المرضى بنحو 7%، من 11.3 مليون في عام 2018 إلى 12.1 مليون في عام 2022، في حين تتقدم القوة العاملة من المبرمجين في العمر وتغلق الجامعات برامج إدارة المعلومات الصحية. فقد توقف نصف دورات إدارة المعلومات الصحية الجامعية المعروضة بسبب انخفاض معدلات التسجيل، وهو ما أشار إليه المعهد الأسترالي للصحة والرعاية (AIHW) في تحليله لنقص القوى العاملة في الترميز. على سبيل المثال، انتقلت مستشفى Northern Health في فيكتوريا من نظامها القديم لهذا السبب تحديداً. وصرحت مديرة خدمات المعلومات الصحية لديها، Odette Taylor، أن مكون الذكاء الاصطناعي يقلل الحاجة إلى توسيع القوى العاملة في الترميز مع ارتفاع حالات الخروج، ويوفر ملاحظات فورية للمبرمجين لدعم دقة تقارير DRG و NWAU.
التحليل التقني
إن الترميز التلقائي بالكامل غير قابل للدفاع عنه حالياً. أقوى مرجع هنا هو معيار NEJM AI الذي أجراه Soroush وزملاؤه، والذي اختبر GPT-3.5، GPT-4، Gemini Pro، و Llama2-70b على توليد أكواد ICD-9-CM، ICD-10-CM، و CPT. كان GPT-4 الأفضل بينها، لكنه حقق 33.9% فقط من المطابقة الدقيقة لأكواد ICD-10-CM. النماذج أنتجت أيضاً أكواداً تبدو صحيحة لكنها غير قابلة للفوترة، أو ببساطة أكواداً مُختلقة. هذا الاختبار كان يستند إلى البحث عن أكواد من وصف مُقدم، وهو أسهل من استخلاص كود من ملخص خروج.
تتعقد الصورة في السياق الأسترالي. تُرمز حالات الدخول هنا وفقاً لـ ICD-10-AM/ACHI/ACS Thirteenth Edition، الساري للمرضى الخارجين اعتباراً من 1 يوليو 2025، مع نظام AR-DRG V12.0 المطابق. يخصص AR-DRG V12.0 مستويات تعقيد التشخيص عبر 11,057 كوداً مدرجاً في ICD-10-AM. النموذج العام المدرب على التعديل السريري الأمريكي لا يعرف هذا التصنيف، وتتغير الإصدارات في دورة مدتها ثلاث سنوات. أي نظام يُبنى يجب أن يكون مرتبطاً بالإصدار الساري في تاريخ خروج المريض، وليس بما استوعبه النموذج أثناء التدريب.
التهيئة المساعدة تمثل قصة مختلفة. وجدت تجربة سريرية عشوائية مدتها 13 أسبوعاً، شملت عشرة متخصصين معتمدين في الترميز ونُشرت في npj Digital Medicine، أن سير العمل المدعوم بالذكاء الاصطناعي قلل بشكل كبير وقت الترميز مع الحفاظ على الدقة. تباين الرضا مع خبرة المبرمجين وشهاداتهم، وهو ما يهم أكثر مما يبدو؛ فالأداة التي لا يثق بها كبار المبرمجين سيتم التحايل عليها. يشير التوجيه الوطني لجمعية إدارة المعلومات الصحية (HIMAA) للبيانات المرمزة سريرياً والمولدة بالذكاء الاصطناعي إلى نفس النتيجة، حيث يدرج الخبرة البشرية والتفاعل البشري ضمن اعتباراته السبعة، ويلاحظ بصراحة أن الأدلة المنشورة حول الفائدة في السياق الأسترالي لا تزال غائبة.
هيكلية الاقتراحات
النموذج المقترح يتكون من العناصر التالية:
- الوثائق تدخل عبر HL7 v2 أو FHIR من نظام السجلات الطبية الإلكترونية (EMR) ونظام قبول المرضى (PAS): ملخص الخروج، تقارير العمليات، ملاحظات التقدم، علم الأمراض. PicNet بنت Centazio لهذه التكاملات.
- فهرس أكواد مُنشأ من قوائم IHACPA المرخصة لكل إصدار، محفوظ بشكل منفصل لكل إصدار، مع تحديد تاريخ الفصل للفهرس المستعلم عنه.
- الاسترجاع أولاً، ثم التوليد ثانياً. النموذج لا يُصدر سلسلة كود بحرية. يقترح مرشحين من المجموعة المسترجعة، وأي شيء غير موجود في فهرس هذا الإصدار يتم التخلص منه قبل أن يصل إلى العنصر البشري.
- طبقة قواعد تطبق فحوصات المعايير الأسترالية للترميز (ACS): تسلسل التشخيص الرئيسي، معايير التشخيص الإضافي، أزواج ACHI الإلزامية.
- لوحة موجهة للمبرمج تعرض كل كود مقترح مع نطاق النص الدقيق الذي جاء منه.
- سجل تدقيق للإضافة فقط، يُكتب قبل أن يرى المبرمج أي شيء.
سجل التدقيق ضروري لتجنب الأخطاء المكلفة. يجب أن يتضمن حقولاً مثل "episode_id"، و"separation_date": "2026-03-14"، و"classification_edition": "ICD-10-AM 13th"، و"grouper_version": "AR-DRG V12.0"، و"model_id": "coder-assist-2026-02"، واقتراحات تتضمن "code": "J45.0"، و"confidence": 0.82، و"evidence_doc": "DS-4471". هذا السجل يوفر شيئين: خارجياً، يثبت أن إنساناً مؤهلاً قام بتعيين كل كود وأن الأداة اقترحت بدلاً من أن تقرر. داخلياً، هو حلقة التغذية الراجعة للجودة. الأخطاء في الترميز منهجية وليست عشوائية: أظهرت مراجعات خارجية لـ 55 مستشفى عبر ولايتين، شملت 6,300 سجل، معدل عدم تطابق متوقعاً لـ DRG بنسبة 5.9%. في إحدى المستشفيات، ترجمت نسبة عدم تطابق بلغت 5.6% إلى ما يقارب $8 مليون دولار أقل في التمويل.
السياق وتأثير السوق
تندرج أداة الاقتراحات الموجهة للمبرمجين عموماً خارج تنظيم الأجهزة الطبية التابع لـ TGA بموجب الاستثناء 14G، الذي يغطي البرمجيات المخصصة لإدارة العمليات الصحية، بما في ذلك السجلات المالية والمطالبات والفوترة. ينطبق هذا الاستثناء فقط إذا استوفت كل وظيفة المعايير ولم تؤثر الأداة على اتخاذ القرارات السريرية. اللحظة التي يُطلب فيها عرض الاقتراحات على الأطباء المعالجين أثناء حلقة العلاج، يتغير الغرض المقصود، ويلزم إعادة فحص التصنيف.
يمكن أن تتبع الحوكمة دليل الاستخدام السريري للذكاء الاصطناعي الصادر عن ACSQHC، الذي صدر في أغسطس 2025، ويتمحور حول ثلاث مراحل: قبل الاستخدام، أثناء الاستخدام، وبعد الاستخدام. هذه المراحل الثلاث تتوافق بشكل واضح مع مراجعة الأدلة، وتدريب المبرمجين مع المراقبة، وإعادة التقييم المجدولة بعد كل تغيير في إصدار التصنيف.
تُعد الخصوصية الجزء الذي يجب أن يصل إلى مجلس الإدارة. هذه الأنظمة تستوعب ملخصات الخروج الكاملة، وتقارير العمليات، وملاحظات التقدم. كان مقدمو الخدمات الصحية القطاع الأكثر عرضة للاختراقات في إحصائيات اختراقات البيانات القابلة للإبلاغ لـ OAIC لعام 2025، بنسبة 19% من الإشعارات (225 من أصل 1,205). يجب اتخاذ قرار مبكر بشأن ما إذا كانت عملية الاستدلال ستعمل في بنية تحتية مستضافة في أستراليا، ومن يمكنه الاستعلام عن الفهرس، ومدة الاحتفاظ بحمولات الطلبات. هذه الإجابات يصعب تغييرها لاحقاً.
تتضمن التكاليف تراخيص منتجات تصنيف IHACPA، وإعادة فهرسة وتحقق كل ثلاث سنوات عند تغيير الإصدار، وتكاليف الاستدلال التي تتناسب مع حجم الوثائق بدلاً من عدد الحالات. التكلفة الأكبر ليست النموذج نفسه. إنها تجميع مجموعة تقييم مرمزة ذهبياً من حالات الخروج الخاصة بالمؤسسة، يفضل أن تكون مراجعة من قبل مدققين، بالإضافة إلى ساعات عمل المبرمجين لإجراء قياس دقيق قبل وبعد. بدون هذه المجموعة، لا يمكن تحديد ما إذا كانت الأداة تساعد أم أنها تُعلّم الفريق بصمت قبول أكواد خاطئة ولكنها معقولة، وهو نمط الفشل الذي يثير القلق الأكبر. البدء بتخصص واحد عالي الكثافة، وقياس الدقائق لكل حالة ومعدل عدم التطابق بعد التدقيق مقابل خط أساس مطابق، مع إبقاء المبرمج كشخص يقوم بتعيين الكود، هو التكوين الذي تدعمه الأدلة.
رؤية Glitch4Techs
إن الاعتماد على الذكاء الاصطناعي كمحرك اقتراحات للترميز الطبي، بدلاً من نظام مستقل تماماً، هو حل براغماتي فرضته قيود الواقع. الأتمتة الكاملة في هذا المجال غير قابلة للتطبيق وذات مخاطر لا يمكن تحملها. تشير نتائج معيار NEJM AI، التي أظهرت أن GPT-4 حقق 33.9% فقط من المطابقة الدقيقة لأكواد ICD-10-CM، بوضوح إلى عدم موثوقية النماذج اللغوية الكبيرة العامة للمهام الدقيقة وعالية المخاطر كهذه. تضاف إلى ذلك التعقيدات التنظيمية الأسترالية، مثل التحديث الدوري لتصنيف ICD-10-AM كل ثلاث سنوات واشتمال AR-DRG V12.0 على 11,057 كوداً، بالإضافة إلى المخاطر المالية المتمثلة في خسارة $8 مليون دولار بسبب أخطاء الترميز وتقرير OAIC 2025 الذي أظهر أن مقدمي الخدمات الصحية يمثلون 19% من إشعارات خرق البيانات. هذه العوامل مجتمعة تحكم على أي محاولة للأتمتة الكاملة بالفشل الذريع وتضع المؤسسات تحت طائلة مخاطر مالية وتشغيلية وقانونية غير مقبولة. أي نشر يتجاوز دور الاقتراح المساعد هو تهور غير مبرر.
كن أول من يعرف بمستقبل التقنية
أهم الأخبار والتحليلات التقنية مباشرة في بريدك.
مقالات قد تهمك

آبل تقاضي OpenAI: صراع على أسرار تجارية عبر موظفين سابقين

نماذج OpenAI تخترق Hugging Face: الذكاء الاصطناعي يتقن الغش

مايكروسوفت: 3.2 مليار دولار من Anthropic وتراجع OpenAI بـ 600 مليون
