Google DeepMind merilis EmbeddingGemma 2 pada 6 Oktober 2026. Model embedding multimodal open-weight ini memetakan teks, gambar, audio, dan frame video ke ruang vektor 768 dimensi yang sama. Targetnya bukan membuat chatbot, melainkan membantu aplikasi mencari dan membandingkan konten lintas format secara lokal, dengan latensi dan kebutuhan memori yang lebih rendah.

Sumber https://developers.googleblog.com/en/google-ai-edge-with-embeddinggemma-2/

Embedding adalah representasi numerik dari sebuah input. Dalam mesin pencari semantik, sistem mengubah pertanyaan dan dokumen menjadi vektor lalu menghitung kedekatan di antara keduanya. Karena yang dibandingkan adalah representasi makna, hasil pencarian tidak harus bergantung pada kecocokan kata secara persis. Teknik ini menjadi dasar untuk retrieval-augmented generation, rekomendasi, klasifikasi, clustering, pencarian kode, dan pengelompokan arsip media.

EmbeddingGemma 2 membawa pola itu ke beberapa modalitas dalam satu ruang representasi. Pengembang dapat, misalnya, mencari gambar menggunakan kalimat, menemukan potongan video berdasarkan deskripsi, atau mencocokkan rekaman audio dengan kueri teks. Google menempatkannya untuk aplikasi edge dan on-device, sehingga tahap pencarian dapat berjalan di perangkat pengguna atau server kecil tanpa selalu mengirim bahan mentah ke cloud.

Dokumentasi resmi: https://ai.google.dev/gemma/docs/embeddinggemma

Model ini memiliki 740 juta parameter untuk konfigurasi multimodal penuh. Arsitekturnya modular: Google mendokumentasikan konfigurasi mulai dari 270 juta parameter untuk teks dan kode hingga model penuh yang mencakup teks, gambar, audio, dan video. Pada halaman pengumuman, Google menyebut kebutuhan active RAM sekitar 191 MB untuk bobot teks saja dan sekitar 567 MB untuk model multimodal penuh pada pengujian menggunakan Pixel 11 Pro. Angka tersebut adalah hasil pengujian Google, bukan jaminan untuk setiap perangkat atau aplikasi.

Satu ruang vektor juga mengurangi kebutuhan merangkai beberapa model terpisah. Sistem pencarian media biasanya memerlukan model captioning untuk gambar, speech-to-text untuk audio, dan embedding teks untuk menghubungkan hasilnya. EmbeddingGemma 2 mencoba menggabungkan pekerjaan representasi itu dalam satu keluarga model. Dampaknya bukan hanya jumlah komponen yang lebih sedikit, tetapi juga pipeline yang lebih mudah dirancang untuk pencarian lintas format.

Google menyediakan output 768 dimensi, tetapi EmbeddingGemma 2 mendukung Matryoshka Representation Learning. Pengembang dapat memangkas vektor ke 512, 256, atau 128 dimensi untuk mengurangi penggunaan storage dan mempercepat pencarian. Dokumentasi memperingatkan bahwa vektor yang dipangkas perlu dinormalisasi kembali sebelum dipakai untuk cosine similarity, dan query serta dokumen harus menggunakan dimensi yang sama. Detail kecil seperti ini penting karena kesalahan konfigurasi dapat menghasilkan ranking yang terlihat masuk akal tetapi sebenarnya menurun.

Developer guide: https://developers.googleblog.com/en/embeddinggemma-2-the-developer-guide/

Model ini juga membuka jalur zero-shot classification. Pengembang dapat membandingkan embedding input dengan embedding label atau deskripsi kelas tanpa melatih classifier khusus terlebih dahulu. Untuk aplikasi di ponsel, kemampuan semacam ini dapat dipakai untuk routing intent, pencarian catatan offline, penyaringan konten, atau pengelompokan foto. Namun, hasil zero-shot tetap perlu diuji dengan data pengguna sebenarnya. Label yang ambigu, bahasa lokal, istilah teknis, dan distribusi data yang berubah dapat menggeser hasil secara signifikan.

EmbeddingGemma 2 dirilis dengan bobot terbuka dan lisensi Apache 2.0 menurut dokumentasi Google. Itu memberi ruang bagi pengembang untuk menjalankan dan menyesuaikan model sendiri, tetapi open-weight tidak menghapus kewajiban memeriksa kebijakan penggunaan, lisensi komponen lain, dan kebutuhan hardware. Model juga bukan database keamanan. Data sensitif masih dapat bocor melalui log aplikasi, vector database, telemetry, atau layanan lain yang mengelilingi model.

Model card Google menempatkan tanggung jawab evaluasi pada pengembang dan deployer. Risiko embedding muncul dari cara representasi itu dipakai: sistem dapat mengurutkan, mengelompokkan, atau mengambil konten secara bias; aplikasi juga bisa memakai hasil retrieval sebagai keputusan final padahal model hanya menghasilkan sinyal kemiripan. Untuk moderasi, kesehatan, akses layanan, atau keputusan berisiko tinggi, retrieval perlu dilengkapi filter, evaluasi fairness, dan peninjauan manusia.

Model card: https://ai.google.dev/gemma/docs/embeddinggemma/model_card_2

Dari sudut pandang produk, EmbeddingGemma 2 menarik bukan karena ia menggantikan chatbot. Nilainya ada pada lapisan pencarian yang biasanya tidak terlihat pengguna. Aplikasi catatan, katalog, arsip berita, pencarian kode, dan perpustakaan media dapat menemukan hubungan lintas teks dan gambar dengan lebih sedikit ketergantungan pada API cloud.

Tetap ada trade-off. Model 740 juta parameter lebih kecil daripada banyak model generatif, tetapi deployment multimodal penuh masih membutuhkan pengujian latency, RAM, dan konsumsi daya. Pengembang juga harus mengukur kualitas pada bahasa serta domain mereka sendiri, bukan hanya mengandalkan benchmark atau demo resmi. EmbeddingGemma 2 membuat pencarian multimodal lokal lebih mudah dijangkau, tetapi kualitas pengalaman akhirnya tetap ditentukan oleh indeks, chunking, metadata, ranking, dan evaluasi aplikasi.

Google tidak sedang menjual EmbeddingGemma 2 sebagai jawaban percakapan baru. Ia menyediakan fondasi untuk membuat aplikasi memahami kedekatan makna antarformat—lebih dekat ke pengguna, lebih fleksibel untuk deployment edge, dan dalam konfigurasi tertentu lebih privat. Ujian sebenarnya dimulai setelah model dipasang pada data nyata, ketika kecepatan harus berhadapan dengan kualitas hasil dan batasan perangkat.