Llama Nemoretriever Colembed: 性能领先的文本-图像检索模型
计算机视觉与模式识别
2025-07-09 v1 人工智能
摘要
受跨模态检索系统日益增长的需求驱动,我们推出了llama-nemoretriever-colembed,一个统一的文本-图像检索模型,在多个基准测试中均达到了最先进的性能。我们发布了两个模型变体:1B和3B。3B模型实现了最先进的性能,在ViDoRe V1上NDCG@5得分为91.0,在ViDoRe V2上得分为63.5,截至2025年6月27日,在两个排行榜上均位列第一。我们的方法利用了NVIDIA Eagle2视觉语言模型(VLM),通过将因果注意力替换为双向注意力来修改其架构,并集成了ColBERT风格的后期交互机制,以在共享嵌入空间中实现细粒度多模态检索。虽然这种机制提供了卓越的检索精度,但它也在存储和效率方面引入了权衡。我们对这些权衡进行了全面分析。此外,我们采用了两阶段训练策略来增强模型的检索能力。
引用
@article{arxiv.2507.05513,
title = {Llama Nemoretriever Colembed: Top-Performing Text-Image Retrieval Model},
author = {Mengyao Xu and Gabriel Moreira and Ronay Ak and Radek Osmulski and Yauhen Babakhin and Zhiding Yu and Benedikt Schifferer and Even Oldridge},
journal= {arXiv preprint arXiv:2507.05513},
year = {2025}
}