中文

Omni-Embed-Nemotron:面向文本、图像、音频与视频的统一多模态检索模型

计算与语言 2025-10-07 v1

摘要

我们提出 Omni-Embed-Nemotron,一个统一的多模态检索嵌入模型,用于处理日益复杂的实际信息需求。虽然检索增强生成 (RAG) 已显著推动语言模型通过整合外部知识取得进步,但现有基于文本的检索器依赖干净、结构化的输入,在处理 PDF、幻灯片或视频等真实文档中所包含的视觉和语义丰富内容时常常力不从心。近期工作如 ColPali 通过保留文档布局的图像-表征方法可提高检索质量。基于此,受最新多模态模型如 Qwen2.5-Omni 能力的启发,我们将检索扩展Beyond 文本和图像,亦支持音频和视频模态。Omni-Embed-Nemotron 实现了跨模态 (如文本-视频) 和联合模态 (如文本-视频+音频) 检索,单一模型即可完成。我们描述了模型架构、训练设置和评估结果,并展示了其在文本、图像和视频检索中的有效性。

关键词

引用

@article{arxiv.2510.03458,
  title  = {Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video},
  author = {Mengyao Xu and Wenfei Zhou and Yauhen Babakhin and Gabriel Moreira and Ronay Ak and Radek Osmulski and Bo Liu and Even Oldridge and Benedikt Schifferer},
  journal= {arXiv preprint arXiv:2510.03458},
  year   = {2025}
}