بنچمارک مدلهای امبدینگ فارسی و چندزبانه در تسکهای بازیابی
ارزیابی کمی و مقایسه جامع دقت شباهت معنایی مدلهای Cohere، OpenAI و مدلهای متنباز BGE بر روی متون فارسی.

- مدل BGE-M3 در زبان فارسی به دلیل پشتیبانی چندزبانه متوازن رتبه اول را در بنچمارک دقت حفظ کرده است.
- طول ابعاد ورید ۱024 نسبت به 1536 برای اکثر موارد تعادل ایدهآلی میان هزینه رم و دقت برقرار میسازد.
انتخاب مدل Embedding برای زبان فارسی یکی از تعیینکنندهترین گامها در طراحی Pipelineهای بازیابی معنایی است. در این گزارش مقایسهای، متریکهای MRR و NDCG@10 را روی Datasetهای مختلف بررسی میکنیم.
درباره نویسنده: واحد پژوهش ۲رگ
پژوهشگران آزمایشگاه ۲رگ متمرکز بر بنچمارک و انطباق مدلهای هوش مصنوعی با زبان و فرهنگ فارسی.
مطالب و راهنماهای مرتبط

RAG از کجا شروع میشود؟ معماری Pipeline بازیابی داده
یک راهنمای عمیق و کاربردی برای متصلکردن مدلهای زبانی به اسناد سازمانی و دادههای واقعی بدون پیچیدگیهای اضافه.

AI Agent دقیقاً چه کاری انجام میدهد؟ کالبدشکافی معماری ایجنتها
کالبدشکافی معماری AI Agentها: چطور ابزارها، حافظه و برنامهریزی یک مدل زبانی را به کنشگر واقعی تبدیل میکنند.

اتوماسیونی که واقعاً وقت ذخیره میکند: فراتر از اسکریپتهای ساده
طراحی Workflowهای هوشمند که هزینههای تکراری را کاهش داده و خطای انسانی را به حداقل ممکن میرسانند.
۲رگ را دنبال کنید
تازههای AI، تحلیلها، ابزارهای جدید و پروژههایی که در استودیو میسازیم.

