中文

CLaMR:多模态内容检索中的上下文感知晚期交互

计算机视觉与模式识别 2025-06-09 v1 计算与语言 信息检索

摘要

在线视频网页内容具有丰富的多模态特征:单个视频融合了视觉、语音、环境音频和屏幕文本。检索系统通常将这些模态视为独立的检索来源,这可能导致噪声较大,检索效果不佳。我们探索了多模态视频内容检索,其中相关性可以来自单个模态或跨多个模态的联合评分。因此,有效的检索器必须动态选择哪种模态(或模态集合)最能解决查询。我们引入CLaMR,一种多模态晚期交互检索器,联合索引了4种模态:视频帧、转录语音、屏幕文本和元数据。CLaMR使用统一的多模态主干网络对所有模态进行联合编码,以实现更好的上下文化,并通过两种关键创新进行动态模态选择训练。首先,鉴于多模态检索训练数据匮乏,我们构建了一个大型合成训练数据集MultiVENT 2.0++,基于MultiVENT 2.0(各种语言的事件导向视频配对查询)构建,包含针对特定模态的查询。其次,我们提出一种模态感知损失,联合训练以标准对比目标为导向,同时学习正确的模态使用。在MultiVENT 2.0++和MSRVTT的测试集上,传统聚合策略(如基线检索器的相似度平均)会引入来自无关模态的噪声,导致性能下降。相比之下,CLaMR consistently 超过现有检索器:在MultiVENT 2.0++上,CLaMR的nDCG@10比最佳单模态检索器提高25.6,比最佳多模态检索器提高35.4。我们在长视频问答中展示了CLaMR的下游效用:在Video-MME上相对于LanguageBind提高3.50%,在LongVideoBench上相对于稠密抽样提高1.42%。

关键词

引用

@article{arxiv.2506.06144,
  title  = {CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval},
  author = {David Wan and Han Wang and Elias Stengel-Eskin and Jaemin Cho and Mohit Bansal},
  journal= {arXiv preprint arXiv:2506.06144},
  year   = {2025}
}

备注

18 pages. Code and data: https://github.com/meetdavidwan/clamr