中文

MLLM作为视频叙述者:缓解视频时刻检索中的模态不平衡

计算机视觉与模式识别 2024-06-27 v1

摘要

视频时刻检索(VMR)旨在根据自然语言查询,在未修剪的长视频中定位特定的时间片段。现有方法常因训练标注不足而受限,即句子通常仅匹配前景中一小部分显著视频内容,且用词多样性有限。这种内在的模态不平衡使得大量视觉信息未能与文本对齐。它将跨模态对齐知识限制在有限文本语料库的范围内,从而导致次优的视觉-文本建模和较差的泛化能力。通过利用多模态大语言模型(MLLM)的视觉-文本理解能力,在这项工作中,我们将MLLM作为视频叙述者,生成视频的合理文本描述,从而缓解模态不平衡并提升时间定位能力。为了有效保持定位所需的时间敏感性,我们设计为每个特定视频时间戳生成文本叙述,并构建带有时间信息的结构化文本段落,使其与视觉内容在时间上对齐。然后,我们在时间感知的叙述与相应的视频时间特征之间执行跨模态特征融合,以生成语义增强的视频表示序列用于查询定位。随后,我们引入了一种单模态叙述-查询匹配机制,该机制鼓励模型从上下文连贯的描述中提取互补信息以改进检索。在两个基准上的大量实验证明了我们提出方法的有效性和泛化能力。

关键词

引用

@article{arxiv.2406.17880,
  title  = {MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval},
  author = {Weitong Cai and Jiabo Huang and Shaogang Gong and Hailin Jin and Yang Liu},
  journal= {arXiv preprint arXiv:2406.17880},
  year   = {2024}
}

备注

Under review