مدلهای زبان-تصویر (VLM) چه تفاوتی با مدلهای زبان دارند؟
الف) VLMها میتوانند تصاویر و متن را به طور همزمان پردازش کنند، در حالی که LLMها فقط متن را پردازش میکنند. ب) VLMها فقط برای تولید تصاویر از متن استفاده میشوند، اما LLMها برای تولید متن هستند. ج) VLMها از معماریهای پیچیدهتر برای پردازش تصاویر استفاده میکنند، در حالی که LLMها سادهتر هستند. د) VLMها فقط برای کارهای تصویری مانند تشخیص اشیاء مناسب هستند.
کدام یک از معماریهای زیر برای VLM مناسب است؟
الف) معماری Encoder-Decoder با مکانیزم Cross-Attention. ب) معماری فقط Decoder با Self-Attention. ج) معماری فقط Encoder با Pooling. د) شبکههای کانولوشنی (CNN) با لایههای کاملاً متصل.
"Cross-modal attention" در VLM به چه معناست؟
الف) تمرکز مدل روی یک نوع داده (مثلاً فقط تصویر یا فقط متن). ب) مکانیزمی برای برقراری ارتباط بین ویژگیهای تصویر و متن. ج) بهینهسازی مدل برای کاهش زمان پردازش دادهها. د) افزایش دقت مدل در پردازش تکمدالیته.
کدام یک از موارد زیر، کاربرد اصلی مدل CLIP است؟
الف) تولید تصاویر از متن مانند مدلهای مولد (Generative Models). ب) ایجاد فضای امبدینگ مشترک برای تصاویر و متن. ج) ترجمه متن به زبانهای مختلف با استفاده از تصاویر. د) شناسایی و دستهبندی اشیاء در تصاویر بدون نیاز به متن.
در مدل CLIP، کدام فرآیند برای ایجاد ارتباط بین تصاویر و متن استفاده میشود؟
الف) یادگیری نظارتشده با برچسبهای دستی. ب) یادگیری کنتراستیو برای همراستا کردن تصاویر و متن. ج) یادگیری تقویتی برای بهینهسازی امبدینگها. د) یادگیری بدون نظارت برای استخراج ویژگیها.
کدام مدل برای تولید کپشن تصاویر مناسب است؟
الف) BLIP-2 ب) DALL-E ج) ViT (Vision Transformer) د) T5
کدام یک از چالشهای زیر در پردازش ویدئو با VLM وجود دارد؟
الف) مصرف حافظه بالا به دلیل حجم دادههای ویدئویی. ب) پیچیدگی محاسباتی به دلیل پردازش فریمهای متوالی. ج) محدودیت در کیفیت و طول ویدئوها. د) همه موارد بالا.
"Cross-modal retrieval" در RAG به چه معناست؟
الف) جستجوی همزمان تصاویر و متن در یک فضای مشترک. ب) بازیابی متن با استفاده از مدلهای تکمدالیته. ج) جستجوی تصاویر بدون استفاده از اطلاعات متنی. د) تولید محتوای چندرسانهای از دادههای متنی.
- مدلهای Qwen 2.5-VL، Gemma3، LLAMA3.2-11b vision و غیره را لود کنید
- مجموعهای از تصاویر مختلف (طبیعت، اشیاء، افراد) جمعآوری کنید
- برای هر تصویر، کپشن فارسی و همچنین کپشن انگلیسی تولید کنید
- سعی کنید کپشنهایی تولید کنید که دقیق و خیلی جزئینگر باشند (پرامپت خوب) چرا که در تمرینات بعدی استفاده خواهند شد
- از دیتایی که در مینی پروژه قبلی آماده کردهاید استفاده کنید (فقط تصاویر و کپشنهای انگلیسی)
- مدل CLIP را برای ایجاد امبدینگهای تصاویر و متن استفاده کنید
- یک سیستم جستجو پیادهسازی کنید که بتواند:
- با جستجوی متنی، تصاویر مرتبط را پیدا کند
- با آپلود تصویر، تصاویر مشابه را پیدا کند
- عملکرد سیستم را با چند نمونه ارزیابی کنید
- (در واقع embedding محاسیه میکنید و شباهتسنجی میکنید برای متن و تصویر)
هدف: ایجاد یک دستیار که بتواند تصاویر پزشکی را تحلیل کرده و به سوالات پاسخ دهد
مراحل پیادهسازی:
-
آمادهسازی داده:
- مجموعهای از تصاویر X-ray یا MRI جمعآوری کنید
- کپشنهای پزشکی برای هر تصویر ایجاد کنید
- دادهها را به train/test تقسیم کنید
-
Fine-tuning مدل:
- از LoRA برای fine-tuning مدل VLM استفاده کنید
- مدل را روی دادههای پزشکی آموزش دهید
- عملکرد مدل را ارزیابی کنید
-
سیستم تشخیص:
- امکان پاسخ به سوالات پزشکی فراهم کنید
- دقت تشخیص را محاسبه کنید
-
ارزیابی مدل:
- عملکرد مدل را روی دادههای تست ارزیابی کنید
- دقت تشخیص ناهنجاریها را محاسبه کنید
هدف: ایجاد یک سیستم پاسخ به سوالات از مقالات علمی که شامل تصاویر، جداول و فرمولها است
مراحل پیادهسازی:
-
آمادهسازی داده:
- از یک مقاله (مقالهای که به تازگی خواندهاید) چند صفحه که با تصاویر و جداول و فرمول باشد انتخاب کنید
- (دستی میتوانید این کار را انجام دهید ولی به عنوان کار اختیاری و امتیازی میتوانید تحقیق کرده و از ابزارهای موجود استفاده کنید) تصاویر، جداول و فرمولها را استخراج کنید
- متن مقاله را به بخشهای کوچک تقسیم کنید
-
پردازش تصاویر:
- از Qwen 2.5-VL و Gemma3، Llama-3-2-11b و غیره برای استخراج متن از تصاویر و جدول و ... استفاده کنید
- تصاویر، جداول و فرمولها را به متن ساختار یافته تبدیل کنید
- کیفیت استخراج متن را بررسی کنید
-
پیادهسازی RAG:
- از FAISS برای ذخیره embeddings استفاده کنید
- سیستم جستجو و بازیابی اطلاعات پیادهسازی کنید
- نتایج را رتبهبندی و فیلتر کنید
- یا از نوتبوک 17 کمک بگیرید: 17_example_rag.ipynb
-
ارزیابی سیستم:
- عملکرد سیستم را روی نمونههای مختلف تست کنید
- دقت پاسخها را ارزیابی کنید
- نتایج را تحلیل و بهبود دهید