Skip to content

Latest commit

 

History

History
172 lines (116 loc) · 8.24 KB

File metadata and controls

172 lines (116 loc) · 8.24 KB

سوالات کوییز و پروژه‌های جامع مدل‌های زبان-تصویر (VLM)

سوالات کوییز

بخش 1: مفاهیم پایه VLM

سوال 1

مدل‌های زبان-تصویر (VLM) چه تفاوتی با مدل‌های زبان دارند؟

الف) VLMها می‌توانند تصاویر و متن را به طور همزمان پردازش کنند، در حالی که LLMها فقط متن را پردازش می‌کنند. ب) VLMها فقط برای تولید تصاویر از متن استفاده می‌شوند، اما LLMها برای تولید متن هستند. ج) VLMها از معماری‌های پیچیده‌تر برای پردازش تصاویر استفاده می‌کنند، در حالی که LLMها ساده‌تر هستند. د) VLMها فقط برای کارهای تصویری مانند تشخیص اشیاء مناسب هستند.

سوال 2

کدام یک از معماری‌های زیر برای VLM مناسب است؟

الف) معماری Encoder-Decoder با مکانیزم Cross-Attention. ب) معماری فقط Decoder با Self-Attention. ج) معماری فقط Encoder با Pooling. د) شبکه‌های کانولوشنی (CNN) با لایه‌های کاملاً متصل.

سوال 3

"Cross-modal attention" در VLM به چه معناست؟

الف) تمرکز مدل روی یک نوع داده (مثلاً فقط تصویر یا فقط متن). ب) مکانیزمی برای برقراری ارتباط بین ویژگی‌های تصویر و متن. ج) بهینه‌سازی مدل برای کاهش زمان پردازش داده‌ها. د) افزایش دقت مدل در پردازش تک‌مدالیته.

بخش 2: مدل CLIP و یادگیری کنتراستیو

سوال 4

کدام یک از موارد زیر، کاربرد اصلی مدل CLIP است؟

الف) تولید تصاویر از متن مانند مدل‌های مولد (Generative Models). ب) ایجاد فضای امبدینگ مشترک برای تصاویر و متن. ج) ترجمه متن به زبان‌های مختلف با استفاده از تصاویر. د) شناسایی و دسته‌بندی اشیاء در تصاویر بدون نیاز به متن.

سوال 5

در مدل CLIP، کدام فرآیند برای ایجاد ارتباط بین تصاویر و متن استفاده می‌شود؟

الف) یادگیری نظارت‌شده با برچسب‌های دستی. ب) یادگیری کنتراستیو برای هم‌راستا کردن تصاویر و متن. ج) یادگیری تقویتی برای بهینه‌سازی امبدینگ‌ها. د) یادگیری بدون نظارت برای استخراج ویژگی‌ها.

بخش 3: مدل‌های VLM و کاربردها

سوال 6

کدام مدل برای تولید کپشن تصاویر مناسب است؟

الف) BLIP-2 ب) DALL-E ج) ViT (Vision Transformer) د) T5

سوال 7

کدام یک از چالش‌های زیر در پردازش ویدئو با VLM وجود دارد؟

الف) مصرف حافظه بالا به دلیل حجم داده‌های ویدئویی. ب) پیچیدگی محاسباتی به دلیل پردازش فریم‌های متوالی. ج) محدودیت در کیفیت و طول ویدئوها. د) همه موارد بالا.

بخش 4: RAG و بازیابی چندرسانه‌ای

سوال 8

"Cross-modal retrieval" در RAG به چه معناست؟

الف) جستجوی همزمان تصاویر و متن در یک فضای مشترک. ب) بازیابی متن با استفاده از مدل‌های تک‌مدالیته. ج) جستجوی تصاویر بدون استفاده از اطلاعات متنی. د) تولید محتوای چندرسانه‌ای از داده‌های متنی.


پروژه‌ها

مینی پروژه 1: تولید کپشن فارسی و انگلیسی

  • مدل‌های Qwen 2.5-VL، Gemma3، LLAMA3.2-11b vision و غیره را لود کنید
  • مجموعه‌ای از تصاویر مختلف (طبیعت، اشیاء، افراد) جمع‌آوری کنید
  • برای هر تصویر، کپشن فارسی و همچنین کپشن انگلیسی تولید کنید
  • سعی کنید کپشن‌هایی تولید کنید که دقیق و خیلی جزئی‌نگر باشند (پرامپت خوب) چرا که در تمرینات بعدی استفاده خواهند شد

مینی پروژه 2: سیستم بازیابی تصویر-متن با CLIP

  • از دیتایی که در مینی پروژه قبلی آماده کرده‌اید استفاده کنید (فقط تصاویر و کپشن‌های انگلیسی)
  • مدل CLIP را برای ایجاد امبدینگ‌های تصاویر و متن استفاده کنید
  • یک سیستم جستجو پیاده‌سازی کنید که بتواند:
    • با جستجوی متنی، تصاویر مرتبط را پیدا کند
    • با آپلود تصویر، تصاویر مشابه را پیدا کند
  • عملکرد سیستم را با چند نمونه ارزیابی کنید
  • (در واقع embedding محاسیه می‌کنید و شباهت‌سنجی می‌کنید برای متن و تصویر)

مینی پروژه 3: دستیار هوشمند تحلیل تصاویر پزشکی

هدف: ایجاد یک دستیار که بتواند تصاویر پزشکی را تحلیل کرده و به سوالات پاسخ دهد

مراحل پیاده‌سازی:

  1. آماده‌سازی داده:

    • مجموعه‌ای از تصاویر X-ray یا MRI جمع‌آوری کنید
    • کپشن‌های پزشکی برای هر تصویر ایجاد کنید
    • داده‌ها را به train/test تقسیم کنید
  2. Fine-tuning مدل:

    • از LoRA برای fine-tuning مدل VLM استفاده کنید
    • مدل را روی داده‌های پزشکی آموزش دهید
    • عملکرد مدل را ارزیابی کنید
  3. سیستم تشخیص:

    • امکان پاسخ به سوالات پزشکی فراهم کنید
    • دقت تشخیص را محاسبه کنید
  4. ارزیابی مدل:

    • عملکرد مدل را روی داده‌های تست ارزیابی کنید
    • دقت تشخیص ناهنجاری‌ها را محاسبه کنید

پروژه نهایی: سیستم Simple Multimodal RAG

هدف: ایجاد یک سیستم پاسخ به سوالات از مقالات علمی که شامل تصاویر، جداول و فرمول‌ها است

مراحل پیاده‌سازی:

  1. آماده‌سازی داده:

    • از یک مقاله (مقاله‌ای که به تازگی خوانده‌اید) چند صفحه که با تصاویر و جداول و فرمول باشد انتخاب کنید
    • (دستی می‌توانید این کار را انجام دهید ولی به عنوان کار اختیاری و امتیازی می‌توانید تحقیق کرده و از ابزارهای موجود استفاده کنید) تصاویر، جداول و فرمول‌ها را استخراج کنید
    • متن مقاله را به بخش‌های کوچک تقسیم کنید
  2. پردازش تصاویر:

    • از Qwen 2.5-VL و Gemma3، Llama-3-2-11b و غیره برای استخراج متن از تصاویر و جدول و ... استفاده کنید
    • تصاویر، جداول و فرمول‌ها را به متن ساختار یافته تبدیل کنید
    • کیفیت استخراج متن را بررسی کنید
  3. پیاده‌سازی RAG:

    • از FAISS برای ذخیره embeddings استفاده کنید
    • سیستم جستجو و بازیابی اطلاعات پیاده‌سازی کنید
    • نتایج را رتبه‌بندی و فیلتر کنید
    • یا از نوتبوک 17 کمک بگیرید: 17_example_rag.ipynb
  4. ارزیابی سیستم:

    • عملکرد سیستم را روی نمونه‌های مختلف تست کنید
    • دقت پاسخ‌ها را ارزیابی کنید
    • نتایج را تحلیل و بهبود دهید