غوغل تطلق EmbeddingGemma 2 بـ740 مليون معامل للبحث
نموذج مفتوح الأوزان بحجم 740 مليون معامل يحوّل النص والشيفرة والصورة والفيديو والصوت إلى فضاء تمثيل مشترك من 768 بُعداً، أطلقته غوغل ديب مايند يوم الثلاثاء 6 أكتوبر. وقالت غوغل إن النموذج مبني على معمارية Gemma 4 وصغير بما يكفي للعمل على الهواتف والحواسيب المحمولة، ويُنشر برخصة أباتشي 2.0.
· نُشر أصلاً على ontime+ · آخر تحقق: 6 أكتوبر 2026 (Nicole Jeffrey)

أبرز النقاط
- غوغل ديب مايند أطلقت نموذجاً مفتوح الأوزان يحوّل النص والصورة والفيديو والصوت إلى فضاء تمثيل واحد.
- النموذج بحجم 740 مليون معامل ويعمل على الهواتف والحواسيب برخصة أباتشي 2.0 التجارية المرنة.
- الإطلاق ينقل عمل غوغل في التمثيلات على الأجهزة من النص فقط إلى الوسائط المتعددة.
خبر:
نموذج مفتوح الأوزان بحجم 740 مليون معامل يحوّل النص والشيفرة والصورة والفيديو والصوت إلى فضاء تمثيل مشترك من 768 بُعداً، أطلقته غوغل ديب مايند يوم الثلاثاء 6 أكتوبر. وقالت غوغل إن النموذج مبني على معمارية Gemma 4 وصغير بما يكفي للعمل على الهواتف والحواسيب المحمولة، ويُنشر برخصة أباتشي 2.0.
تفصيل:
- البنية المعيارية: بحسب دليل المطورين من غوغل، لا يحتاج المطور إلى تحميل النموذج كاملاً: نواة النص والشيفرة 270 مليون معامل، ومرمّز الرؤية يضيف 170 مليوناً، ومرمّز الصوت 300 مليون. وكل تركيبة تنتج متجهات في الفضاء نفسه، ما يتيح مطابقة استعلام نصي مباشرة مع مستندات مُمثَّلة بالنموذج الكامل.
- نافذة السياق: تتشارك كل المدخلات نافذة سياق بطول 8192 رمزاً، أي أربعة أضعاف النموذج الأصلي. وقالت غوغل إن ذلك يكفي لمعالجة ما يصل إلى 29 صورة أو 58 إطاراً من الفيديو أو 5.5 دقائق من الصوت في مدخل واحد.
- الأرقام القياسية: أفادت إنفستينغ دوت كوم بأن النموذج سجّل 78.68 في اختبار الشيفرة ضمن معيار MTEB، بزيادة 9.92 نقطة عن سلفه الذي سجّل 68.76.
- ضغط المتجهات: تتيح تقنية Matryoshka Representation Learning تقليص المتجهات إلى 128 بُعداً، ما يخفض التخزين حتى ستة أضعاف. ويقول دليل المطورين إن متجهات 256 بُعداً تحتفظ بنحو 95% من الجودة الكاملة في استرجاع الصور والفيديو والكلام، بينما تهبط جودة الاسترجاع متعدد الوسائط عند 128 بُعداً إلى نحو 75%.
- حدود السلامة: نقل موقع يونايت دوت إيه آي عن بطاقة النموذج أن EmbeddingGemma 2 لم يخضع لضبط سلامة بعد التدريب، ما يترك ضمانات الحماية على مستوى التطبيق لمسؤولية المطورين أنفسهم.
- استهلاك الذاكرة: قالت غوغل إنه مع التكميم على هاتف بيكسل 11 برو، تستهلك أوزان النص فقط نحو 191 ميغابايت من الذاكرة النشطة، بينما يستهلك النموذج الكامل متعدد الوسائط نحو 567 ميغابايت.
- التطبيقات: أفاد سيكينغ ألفا بأن تطبيق Google AI Edge Gallery سيضيف عرضين مبنيين على النموذج: البحث الفوري في الوسائط للبحث في الصور والفيديوهات المحلية بالوصف، وأداة للعثور على مشاهد داخل الفيديو من دون تفريغ الصوت أولاً. كما قدّمت غوغل تطبيقاً تجريبياً لماك يبحث في محاضر الاجتماعات والملاحظات والمستندات المخزنة على الحاسوب.
- السابقة: صدر النموذج الأول من العائلة في سبتمبر 2025 بحجم 308 ملايين معامل، نصّياً فقط ومبنياً على Gemma 3. وتقول غوغل إنه جرى تنزيله أكثر من 20 مليون مرة.
- التوافر: الأوزان متاحة الآن على هَغينغ فيس وكاغل، وتقول غوغل إن النموذج سيصل إلى ML Kit لأندرويد خلال الأسابيع المقبلة مع دعم تسريع العتاد على الأجهزة المؤهلة. أما التوافر في منصة Gemini Enterprise Agent Platform فلم يُحدَّد له موعد.
خلفية:
التمثيلات الرقمية (Embeddings) تحوّل المحتوى إلى أرقام تلتقط المعنى، وهي الأساس الذي تعتمد عليه أدوات البحث وأنظمة التوليد المعزز بالاسترجاع (RAG) للعثور على المواد ذات الصلة.
بين السطور:
الجمع بين فضاء تمثيل مشترك واحد وحجم ذاكرة لا يتجاوز 567 ميغابايت يوجّه الاستخدام نحو البحث المحلي داخل الجهاز بدل الخوادم. ورخصة أباتشي 2.0 تفتح الباب أمام الاستخدام التجاري، لكن غياب ضبط السلامة بعد التدريب، كما ورد في بطاقة النموذج، ينقل عبء الحماية بالكامل إلى المطور.
ماذا بعد؟
وصول النموذج إلى ML Kit لأندرويد خلال الأسابيع المقبلة، وإتاحته لاحقاً في Gemini Enterprise Agent Platform Model Garden، إضافة إلى إطلاق العرضين التجريبيين في تطبيق Google AI Edge Gallery.