中文

Gemini Embedding 2:来自 Gemini 的原生多模态嵌入模型

计算机视觉与模式识别 2026-05-27 v1

摘要

我们介绍 Gemini Embedding 2,这是一个原生多模态嵌入模型,允许对视频、音频、图像和文本等模态在统一的表示空间中进行嵌入。我们利用 Gemini 的多模态能力,为任意这些模态的交错输入组合生成嵌入,这些嵌入在广泛的任务上表现出良好的泛化能力。通过应用大规模对比学习,在多任务多阶段训练设置中,我们在包括单模态、跨模态和多模态检索等关键嵌入基准测试上实现了最先进的性能。我们展示了该嵌入模型在各种任务中表现出色(在 MSCOCO 上 R@1 为 62.9,在 Vatex 上 NDCG@10 为 68.8,在 MTEB 多语言数据集上为 69.9,在 MTEB Code 上为 84.0),超越了专用模型的性能。这些统一的能力使 Gemini Embedding 2 成为 RAG、推荐和搜索等下游应用的有前景的候选模型。此外,其在天文学、生物学、美术和烹饪艺术等不同领域的强大零样本性能,使其成为高度可靠的即插即用表示,即使针对特定领域也是如此。

关键词

引用

@article{arxiv.2605.27295,
  title  = {Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini},
  author = {Madhuri Shanbhogue and Zhe Li and Shanfeng Zhang and Gustavo Hernández Ábrego and Shih-Cheng Huang and Aashi Jain and Daniel Salz and Sonam Goenka and Chaitra Hegde and Ji Ma and Feiyang Chen and Jiaxing Wu and Tanmaya Dabral and Babak Samari and Kevin Poulet and Daniel Cer and Kaifeng Chen and Paul Suganathan and Hui Hui and Jovan Andonov and Philippe Schlattner and Jay Han and Iftekhar Naim and Wing Lowe and Vladimir Pchelin and Albert Yang and Yi-Ting Chen and Zhongli Ding and Grace Zhang and Georg Heigold and Yichang Chen and Antoine Reveillon and Brendan Mccloskey and Wenlei Zhou and Dahun Kim and Rui Meng and Emma Wang and Jack Zheng and Halley Fede and Zhen Yang and Keegan Mosley and Brian Potetz and Sahil Dua and Henrique Schechter Vera and Shen Gao and Hesen Zhang and Andreas Hess and Hengxuan Ying and Alberto Montes and Karan Gill and Min Choi and Sebastian Russo and Anja Hauth and Jinhyuk Lee and Michael Boratko and Megan Barnes and Vikram Rao and Claudiu Musat and Cyril Allauzen and Ehsan Variani and Shankar Kumar and Tom Bagby and Junyi Jiao and Yang Gu and Tengxin Li and Ayush Agrawal and Roberto Santana and Dev Nath and Stephen Karukas and Shuoxuan Han and Lucia Loher and Alice Twu and Nidhi Vyas and Siddharth Bhai and Frank Palma Gomez and Wangyuan Zhang and Chaoren Liu and Jizheng Yang and Steve Qiu and Shijie Zhang and Sujay Kulkarni and Sascha Rothe and Sean Nakamoto and Raphael Hoffmann and Zach Gleicher and Yunhsuan Sung and Qin Yin and Tom Duerig and Mojtaba Seyedhosseini},
  journal= {arXiv preprint arXiv:2605.27295},
  year   = {2026}
}