الشبكات متعددة الوسائط
هالدرس الإضافي يدرس CLIP وVQGAN+CLIP وDALL·E 1 و2 كمحطات تاريخية في تطور النماذج متعددة الوسائط. هدفه فهم الأفكار، مب تقديم دليل للمنتجات أو النماذج الحالية.
التدريب المسبق التبايني للصور (CLIP)
الفكرة الأساسية في CLIP إنه يقارن موجّهًا نصيًا (text prompt) بصورة، ويقيس وش كثر الصورة متوافقة مع هالموجّه.

يتدرّب النموذج على صور من الإنترنت ومعها أوصافها النصية. في كل دفعة، ناخذ N زوج من (صورة، نص)، ونحوّلها لتمثيلات متجهية I1,..., IN / T1, ..., TN. بعدها نطابق هالتمثيلات مع بعض. نعرّف دالة الخسارة بحيث تزيد تشابه جيب التمام بين المتجهين اللي يرجعون للزوج نفسه (مثل Ii وTi)، وتقلله بين بقية الأزواج. وعشان كذا نسمّي هالنهج تبايني.
نموذج CLIP ومكتبته متوفرين في مستودع OpenAI على GitHub. تلقون شرح النهج في هالتدوينة، وتفاصيله الكاملة في هالبحث.
بعد التدريب المسبق، نقدر نعطي النموذج دفعة صور وموجّهات نصية، ويرجع درجات تشابه؛ ونحوّل الدرجات إلى احتمالات فقط ضمن إعداد تصنيف محدد وبعد التطبيع. نقدر نستخدم CLIP في أكثر من مهمة، ومنها التصنيف:
تصنيف الصور
لو نبغى نصنّف الصور، مثلًا، بين قطط وكلاب وبشر، نعطي النموذج صورة ومعها سلسلة موجّهات نصية: "صورة لقط"، "صورة لكلب"، "صورة لإنسان". ومن المتجه الناتج، اللي فيه 3 احتمالات، نختار الفهرس صاحب أعلى قيمة.
وصف الشكل: استخدام CLIP في تصنيف الصور
الصورة من هالتدوينة
البحث عن الصور بالنص
ونقدر نسوي العكس بعد. إذا عندنا مجموعة صور، نمررها للنموذج مع موجّه نصي، ويرجع لنا الصورة الأكثر شبهًا بالموجّه المعطى.
افتحوا دفتر Clip.ipynb عشان نشوف CLIP وهو يشتغل.
توليد الصور باستخدام VQGAN+CLIP
يمثّل VQGAN الصورة برموز كامنة متقطعة يتعلّمها مشفّر وفاكّ تشفير مع خسائر إدراكية وتنافسية. وفي نهج Taming Transformers يتعلّم محوّل ذاتي الانحدار تسلسل هالرموز؛ يعني المحوّل جزء منفصل فوق تمثيل VQGAN، مب تعريف VQGAN نفسه.
ظهر VQGAN+CLIP لاحقًا كسير عمل تجريبي: يبدأ بصورة أو تمثيل قابل للتحسين، ويستخدم تشابه CLIP كإشارة تدفع الناتج باتجاه النص. هالطريقة محطة تاريخية مفيدة لفهم التوجيه المتعدد الوسائط، لكنها مب وصفًا عامًا لطريقة عمل أنظمة توليد الصور الحالية.
جرّبوا هالفكرة على أصول من تأليفكم أو موثقة الترخيص، وقيّموا الحساسية لصياغة النص والتحيزات بدل الاعتماد على صورة وحدة.
DALL-E
قدّم DALL·E 1 توليد الصور من النص باستخدام محوّل ذاتي الانحدار فوق تسلسل مشترك من رموز النص والصورة.
استخدم DALL·E 2 تمثيلات CLIP ضمن بنية هرمية لتوليد الصور. نعرض النموذجين هنا كتاريخ تقني؛ راجعوا توثيق أي نظام حالي لمعرفة واجهته وقدراته وقيوده.
المراجع