Google, açık ağırlıklı üretken yapay zekâ ailesi Gemma’yı doğrudan uç (edge) donanımlarda semantik arama, metin sınıflandırma ve bilgi getirme (retrieval) süreçlerini kökten dönüştürecek yeni bir modelle genişletti: EmbeddingGemma 2. Akıllı telefonlar, dizüstü bilgisayarlar ve IoT uç birimlerinde hiçbir bulut sunucusuna ihtiyaç duymadan tamamen yerel olarak çalışmak üzere tasarlanan model; kompakt parametre mimarisi, düşük bellek ayak izi ve yüksek boyutsal temsil gücüyle dikkat çekiyor. Özellikle cihaz içi RAG (Retrieval-Augmented Generation – Getirme Destekli Üretim) iş yüklerinde devasa bulut modellerine yakın doğruluk sunan EmbeddingGemma 2, kullanıcı verilerinin cihaz içinde kalmasını sağlayarak veri gizliliğini en üst seviyeye taşıyor.
İçindekiler
1. Uç Donanımlar İçin Minimum Bellek ve Yüksek Hız
Model, donanım kaynaklarının kısıtlı olduğu tüketici elektroniği cihazlarında maksimum verim sağlamak üzere optimize edildi:
-
200-300 MB Bellek Ayak İzi: INT4 ve INT8 kuantizasyon formatları sayesinde sistem belleğinde (RAM) yalnızca 200 ila 300 MB yer kaplayan model, arka planda işletim sistemini yormadan sürekli aktif kalabiliyor.
-
NPU ve Mobil Donanım Hızlandırması: Snapdragon, MediaTek Dimensity ve Apple Silicon serisindeki entegre nöral işlem birimleri (NPU) üzerinde milisaniyeler seviyesinde vektör çıkarma (embedding inference) gerçekleştirebiliyor.
-
Matryoshka Temsili (MRL Desteği): Model, Matryoshka Representation Learning altyapısını destekliyor. Bu özellik sayesinde geliştiriciler, çıktı vektörünü tam boyuttan (örneğin 768 boyut) performanstan ciddi ödün vermeden 256 veya 128 boyuta kırpabiliyor; bu da yerel vektör veri tabanlarının kapladığı depolama alanını 3-4 kat azaltıyor.
2. Cihaz İçi RAG ve Gizlilik Odaklı Kişisel Arama
EmbeddingGemma 2, üretken yapay zekânın kişisel cihazlardaki en büyük darboğazı olan “doğru bağlamı bulma” sorununu yerel olarak çözüyor:
-
Tamamen Çevrim Dışı Semantik Arama: Kullanıcının telefonundaki notlar, e-postalar, PDF belgeleri ve sohbet geçmişi, cihaz içinde anlamsal vektörlere dönüştürülerek indeksleniyor. Arama yaparken anahtar kelime eşleşmesi yerine cümlenin anlamına göre tarama yapılıyor.
-
Yerel LLM’lerle Kusursuz Eşleşme: Cihaz üzerinde çalışan hafif dil modelleri (Gemma 2 2B, Llama 3 1B/3B vb.), EmbeddingGemma 2’nin getirdiği alakalı metin parçalarını okuyarak kullanıcı sorularına sıfır bulut gecikmesiyle doğru yanıtlar üretebiliyor.
-
Sıfır Veri Sızıntısı: Hassas kişisel veya kurumsal belgeler herhangi bir harici API’ye veya bulut sunucusuna gönderilmediği için tam yalıtımlı güvenlik standardı sağlanıyor; uçak modunda dahi tüm RAG döngüsü çalışmaya devam ediyor.
3. MTEB Skorlarında Sınıfının Lideri ve Çok Dilli Destek
Kompakt boyutuna rağmen modelin metin temsil doğruluğu üst parametre segmentindeki çözümlerle yarışıyor:
-
MTEB Başarısı: Metin vektörleştirme alanındaki en kapsamlı kıyaslama olan MTEB (Massive Text Embedding Benchmark) testlerinde EmbeddingGemma 2, kendi boyutundaki modellerin belirgin şekilde önüne geçerek kendisinden 4-5 kat büyük açık modellerle benzer başarım sergiledi.
-
100’den Fazla Dilde Temsil: Model; Türkçe dahil olmak üzere 100’ü aşkın dilde semantik benzerlik, metin kümeleme ve diller arası çapraz arama (cross-lingual retrieval) yapabilecek zengin bir veri kümesiyle eğitildi.
-
Genişletilmiş Bağlam Penceresi: Uzun paragrafları ve teknik dokümanları parçalamaya gerek kalmadan tek seferde vektörleştirebilen optimize edilmiş bir bağlam penceresi sunuluyor.
4. Açık Ağırlıklar ve Kolay Geliştirici Entegrasyonu
Google, modeli yapay zekâ geliştirici topluluğuna tamamen erişilebilir kıldı:
-
Açık Kaynak Dağıtım: Model ağırlıkları Hugging Face, Kaggle ve Google AI Studio üzerinden ticari ve araştırma amaçlı kullanıma açıldı.
-
Geniş Çalışma Zamanı (Runtime) Desteği: MediaPipe, LiteRT (TensorFlow Lite), ONNX Runtime, llama.cpp ve Ollama ile tam uyumlu çalışan model, tek bir kütüphane çağrısıyla Android ve iOS mobil uygulamalarına veya masaüstü yazılımlara entegre edilebiliyor.
5. Google EmbeddingGemma 2 Model Özellikleri
| Özellik | Değer / Açıklama |
| Model Tipi | Metin Vektörleştirme (Text Embedding / Dense Retrieval) |
| Hedef Platform | Mobil cihazlar, dizüstü bilgisayarlar, uç (edge) donanımlar |
| Bellek Tüketimi | Kuantize edilmiş modda (INT4/INT8) ~200 – 300 MB RAM |
| Çıktı Boyutu | 768 boyut (MRL ile dinamik olarak 128 / 256 / 512’ye küçültülebilir) |
| Dil Desteği | 100+ dil (Türkçe dahil çok dilli mimari) |
| Temel Kullanım Senaryoları | Yerel RAG, cihaz içi semantik arama, doküman sınıflandırma |
| Donanım Uyumluluğu | Apple Neural Engine, Qualcomm Hexagon NPU, MediaTek NPU, CPU/GPU |
| Çalışma Ortamları | LiteRT (TFLite), ONNX, llama.cpp, Ollama, MediaPipe |
| Erişim & Lisans | Açık ağırlıklı (Hugging Face, Kaggle, Google AI Studio) |









