رفتن به محتوای اصلی
مدل‌های زبانی و بینایی۷ دقیقه مطالعه۲٬۱۵۰ بازدید

بنچمارک مدل‌های امبدینگ فارسی و چندزبانه در تسک‌های بازیابی

ارزیابی کمی و مقایسه جامع دقت شباهت معنایی مدل‌های Cohere، OpenAI و مدل‌های متن‌باز BGE بر روی متون فارسی.

و
واحد پژوهش ۲رگارزیابی و یادگیری ماشین
سیستم‌های پردازش و تحلیل برداری
تحلیلی و تجربی
نکات کلیدی و خلاصه اجرایی (TL;DR)
  • مدل BGE-M3 در زبان فارسی به دلیل پشتیبانی چندزبانه متوازن رتبه اول را در بنچمارک دقت حفظ کرده است.
  • طول ابعاد ورید ۱024 نسبت به 1536 برای اکثر موارد تعادل ایده‌آلی میان هزینه رم و دقت برقرار می‌سازد.

انتخاب مدل Embedding برای زبان فارسی یکی از تعیین‌کننده‌ترین گام‌ها در طراحی Pipelineهای بازیابی معنایی است. در این گزارش مقایسه‌ای، متریک‌های MRR و NDCG@10 را روی Datasetهای مختلف بررسی می‌کنیم.

دست صلح پیکسلی
این مطلب را برای همکارانتان بفرستیداشتراک‌گذاری در شبکه‌های اجتماعی
و

درباره نویسنده: واحد پژوهش ۲رگ

ارزیابی و یادگیری ماشین

پژوهشگران آزمایشگاه ۲رگ متمرکز بر بنچمارک و انطباق مدل‌های هوش مصنوعی با زبان و فرهنگ فارسی.

ادامه مسیر یادگیری
مشاهده همه مقالات

۲رگ را دنبال کنید

تازه‌های AI، تحلیل‌ها، ابزارهای جدید و پروژه‌هایی که در استودیو می‌سازیم.

روح پیکسلی
STAY_CONNECTED