中文

多事件视频-文本检索

计算机视觉与模式识别 2026-01-23 v3 信息检索 机器学习

摘要

视频-文本检索(VTR)在互联网上海量视频-文本数据的时代是一项关键的多模态任务。大量工作以采用双流视觉-语言模型架构学习视频-文本对的联合表示为特征,已成为 VTR 任务的主流方法。然而,这些模型在视频-文本双射对应的假设下运作,忽视了更实际的场景:视频内容通常包含多个事件,而诸如用户查询或网页元数据之类的文本往往特定且对应于单个事件。这在先前训练目标与真实应用间建立了鸿沟,导致早期模型在推理时潜在性能下降。在本研究中,我们引入多事件视频-文本检索(MeVTR)任务,解决每个视频包含多个不同事件的场景,作为传统视频-文本检索任务的一个细分场景。我们提出一个简单模型 Me-Retriever,其结合了关键事件视频表示与一种新的 MeVTR 损失用于 MeVTR 任务。综合实验表明该直接框架在视频到文本与文本到视频任务上优于其他模型,有效建立了 MeVTR 任务的鲁棒基线。我们相信本工作为未来研究奠定坚实基础。代码可在 https://github.com/gengyuanmax/MeVTR 获取。

关键词

引用

@article{arxiv.2308.11551,
  title  = {Multi-event Video-Text Retrieval},
  author = {Gengyuan Zhang and Jisen Ren and Jindong Gu and Volker Tresp},
  journal= {arXiv preprint arXiv:2308.11551},
  year   = {2026}
}

备注

[fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally