اكتشاف الرؤوس باستخدام مجموعة بيانات Hollywood Heads
طبّقوا مفاهيم الدرس في هالمختبر الموجّه.
المهمة
اكتشاف الأشخاص أو الرؤوس يوضح كيف نحول إطارات الفيديو إلى صناديق محيطة وعدّ تقريبي. استخدموا فقط صورًا أو فيديوهات تسمح شروطها بهالاستخدام، ولا تطبقون النموذج على مراقبة أشخاص حقيقيين من غير أساس نظامي وموافقة وضوابط خصوصية مناسبة.
مجموعة البيانات
تحتوي مجموعة بيانات Hollywood Heads على 369,846 رأسًا بشريًا موضّحًا داخل 224,740 إطارًا مأخوذًا من أفلام هوليوود. البيانات متاحة بتنسيق PASCAL VOC، ومع كل صورة ملف وصف بصيغة XML شكله مثل كذا:
قبل التنزيل، راجعوا شروط مجموعة البيانات الحالية ووثّقوا المصدر والإصدار والحقوق المسموحة؛ وجود رابط عام ما يعني تلقائيًا السماح بكل استخدام.
<annotation>
<folder>HollywoodHeads</folder>
<filename>mov_021_149390.jpeg</filename>
<source>
<database>HollywoodHeads 2015 Database</database>
<annotation>HollywoodHeads 2015</annotation>
<image>WILLOW</image>
</source>
<size>
<width>608</width>
<height>320</height>
<depth>3</depth>
</size>
<segmented>0</segmented>
<object>
<name>head</name>
<bndbox>
<xmin>201</xmin>
<ymin>1</ymin>
<xmax>480</xmax>
<ymax>263</ymax>
</bndbox>
<difficult>0</difficult>
</object>
<object>
<name>head</name>
<bndbox>
<xmin>3</xmin>
<ymin>4</ymin>
<xmax>241</xmax>
<ymax>285</ymax>
</bndbox>
<difficult>0</difficult>
</object>
</annotation>
بهالمجموعة عندنا فئة وحدة من الأجسام، وهي head. ولكل رأس نحصل على إحداثيات الصندوق المحيط فيه. تقدرون تحلّلون XML بمكتبات Python، أو تستخدمون هالمكتبة عشان تتعاملون مباشرة مع تنسيق PASCAL VOC.
تدريب نموذج اكتشاف الأجسام
اختاروا مسارًا واحدًا وثبّتوا اعتمادياته:
ابدؤوا بعينة صغيرة، وافصلوا التدريب والتحقق حسب مصدر الفيديو عشان ما تتسرب الإطارات المتجاورة بين القسمين. سجّلوا الدقة والاستدعاء حسب عتبة الثقة، وافحصوا الأخطاء عبر أحجام الرؤوس والإضاءة وزوايا التصوير.
الزبدة
اكتشاف الأجسام مهارة عملية، لكن العدد الناتج تقدير مب حقيقة مضمونة. وثّقوا فشل النموذج، واحموا الخصوصية، ولا تستخدمون الناتج وحده لاتخاذ قرار يؤثر على شخص.