گوگل از EmbeddingGemma ۲ رونمایی کرد؛ تحول در هوش مصنوعی چندوجهی آفلاین

دنیای مدل‌های زبانی کوچک با سرعتی باورنکردنی در حال حرکت به‌سمت پردازش محلی داده‌ها است. پس از استقبال چشمگیر توسعه‌دهندگان از نسل اول EmbeddingGemma و ثبت بیش از ۲۰ میلیون دانلود، نسل تازه‌ی این فناوری با هدف پوشش همزمان چندین نوع محتوا پا به میدان می‌گذارد تا مرزهای پردازش هوشمند روی دستگاه‌های قابل‌حمل را جابه‌جا کند.

به گزارش زومیت، بر اساس بیانیه‌ی گوگل، مدل متن‌باز EmbeddingGemma ۲ با بهره‌گیری از معماری Gemma ۴ و تحت مجوز تجاری Apache ۲.۰ معرفی شده است.

به‌لطف ۷۴۰ میلیون پارامتر، امکان پردازش یکپارچه‌ی متن، کد، تصویر، ویدیو و صوت در یک فضای تعبیه‌سازی مشترک فراهم می‌شود تا کاربر بتواند بدون وابستگی به سرورهای ابری، ویدیوها و فایل‌های صوتی خود را از طریق دستورهای متنی جست‌وجو کند.

مهندسان گوگل با الگوبرداری از فناوری تعبیه‌ساز جمنای، ساختاری کاملا ماژولار برای نسخه‌ی جدید تدارک دیده‌اند. توسعه‌دهندگان می‌توانند متناسب با نیاز خود از بخش متنی با ۲۷۰ میلیون پارامتر استفاده کنند یا در صورت نیاز، رمزگذارهای تصویری با ۱۷۰ میلیون پارامتر و صوتی با ۳۰۰ میلیون پارامتر را برای دستیابی به ظرفیت کامل چندوجهی فعال سازند.

پشتیبانی از فناوری یادگیری بازنمایی ماتریوشکا (MRL) به توسعه‌دهندگان اجازه می‌دهد بردارهای خروجی را از ۷۶۸ بعد به ۵۱۲، ۲۵۶ یا حتی ۱۲۸ بعد کاهش دهند. قابلیت یادشده حجم ذخیره‌سازی پایگاه‌های داده‌ی برداری را تا ۶ برابر کوچک‌تر می‌کند.

پنجره‌ی زمینه‌ی مدل به ۸ هزار توکن افزایش یافته که چهار برابر بیشتر از نسل نخست به‌شمار می‌رود. گستردگی ابعاد پردازش به سیستم امکان می‌دهد تا حداکثر ۵٫۵ دقیقه صوت پیوسته، ۲۹ تصویر، ۵۸ فریم ویدیو یا ترکیبی منعطف از آن‌ها را به‌شکل محلی تحلیل کند.

  • ارتقای امتیاز در بنچمارک MTEB Code از ۶۸٫۷۶ به ۷۸٫۶۸ با رشدی معادل ۹٫۹۲ امتیاز
  • کسب رتبه‌ی برتر در بنچمارک صوتی MAEB در رده‌ی مدل‌های زیر یک میلیارد پارامتر
  • عملکرد فراتر از مدل‌های تخصصی با ابعاد دو برابر بزرگ‌تر در پردازش اسناد و ویدیو

توسعه‌دهندگان هم‌اکنون می‌توانند وزن‌های مدل را از پایگاه‌های Hugging Face و Kaggle دریافت کنند. ابزارهای پرکاربردی همچون MediaPipe و LiteRT و کتابخانه‌ی transformers.js بر بستر WebGPU، فریم‌ورک‌های MLX و vLLM و llama.cpp و SGLang و Ollama و پایگاه برداری Qdrant از روز نخست آماده‌ی استقرار این تعبیه‌ساز هستند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا