معاينة مختبر آمنة
مختبر التعرّف على الكيانات المسماة (NER)
هذي معاينة منقّحة للقراءة فقط؛ ما فيه أي شيء يشتغل داخل الصفحة.
تعليمات المختبر
مختبر التعرّف على الكيانات المسماة (NER)
طبّقوا مفاهيم الدرس في هالمختبر الموجّه.
المطلوب
في هالمختبر، نبي ندرّب نموذجًا للتعرّف على الكيانات المسماة للمصطلحات الطبية.
مجموعة البيانات
عشان ندرّب نموذج NER، نحتاج مجموعة بيانات معلّمة بطريقة صحيحة وفيها كيانات طبية. مجموعة بيانات BC5CDR فيها كيانات معلّمة للأمراض والمواد الكيميائية، مأخوذة من أكثر من 1500 ورقة بحثية. تقدرون تنزّلون مجموعة البيانات بعد التسجيل في موقعهم.
شكل مجموعة بيانات BC5CDR كذا:
6794356|t|Tricuspid valve regurgitation and lithium carbonate toxicity in a newborn infant.
6794356|a|A newborn with massive tricuspid regurgitation, atrial flutter, congestive heart failure, and a high serum lithium level is described. This is the first patient to initially manifest tricuspid regurgitation and atrial flutter, and the 11th described patient with cardiac disease among infants exposed to lithium compounds in the first trimester of pregnancy. Sixty-three percent of these infants had tricuspid valve involvement. Lithium carbonate may be a factor in the increasing incidence of congenital heart disease when taken during early pregnancy. It also causes neurologic depression, cyanosis, and cardiac arrhythmia when consumed prior to delivery.
6794356 0 29 Tricuspid valve regurgitation Disease D014262
6794356 34 51 lithium carbonate Chemical D016651
6794356 52 60 toxicity Disease D064420
...
في أول سطرين عندنا عنوان الورقة وملخّصها. وبعدهم تجي الكيانات واحدًا واحدًا، ومع كل كيان موضع البداية والنهاية داخل كتلة العنوان والملخّص. وفوق نوع الكيان، يعطينا الملف معرّف هالكيان داخل علم الوجود (ontology) الطبي.
بتحتاجون تكتبون كود Python يحوّل هالبيانات إلى ترميز BIO.
الشبكة
نقدر نبني خط أساس بـLSTM مثل مثال الدرس، ثم نقارنه بمحوّل مسبق التدريب. المقارنة العادلة تعتمد على تقسيم البيانات ومقياس الكيانات والتكلفة؛ ما نفترض إن عائلة وحدة تفوز بكل إعداد.
نموذج Microsoft Research اللي كان اسمه PubMedBERT صار اسمه BiomedBERT. بطاقة النموذج توضّح إنه تدرّب مسبقًا من الصفر على ملخصات PubMed، وبعدها نضبطه على مهمة تصنيف الرموز:
from transformers import AutoModelForTokenClassification, AutoTokenizer
model_name = "microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract"
classes = ... # عدد وسوم BIO، ومنها الوسم O
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForTokenClassification.from_pretrained(
model_name,
num_labels=classes,
)
حاذوا وسوم BIO مع الرموز الفرعية، وقيّموا الدقة والاستدعاء وF1 على مستوى الكيان في جزء تحقق منفصل. سجّلوا معرّف النموذج ومراجعته وإصدار البيانات عشان تقدرون تعيدون التجربة.
الزبدة
يقدر NER يساعد في تنظيم الأدبيات الطبية، لكنه ما يثبت علاقة سببية ولا يقدم تشخيصًا. حلّلوا الأخطاء مع مختص بالمجال قبل أي استخدام حساس، ولا تحطون نصوص مرضى أو بيانات صحية خاصة في خدمة خارجية.
هالنشاط فيه تعليمات، بس ما معه معاينة دفتر.
سجّل تطبيقك
التسجيل اختياري، يفيدك تتذكر وش طبّقت، ولا يمنع إكمال الدورة.