中文

面向视频-文本检索的文本自适应多视觉原型匹配

计算机视觉与模式识别 2022-09-28 v1 计算与语言 信息检索

摘要

由于网络上视频的迅速涌现,视频与文本之间的跨模态检索已获得日益增长的研究关注。一般而言,一个视频包含丰富的实例与事件信息,而查询文本仅描述其中一部分信息。因此,一个视频可对应多个不同的文本描述与查询。我们称此现象为“视频-文本对应歧义”问题。当前技术大多集中于挖掘视频与文本内容之间的局部或多级对齐(例如,对象到实体、动作到动词)。这些方法难以通过仅用单一特征描述视频来缓解视频-文本对应歧义,而该单一特征需同时与多个不同文本特征匹配。为解决此问题,我们提出一种文本自适应多视觉原型匹配模型,其通过视频 token 特征的自适应聚合自动捕获多个原型以描述一个视频。给定查询文本,相似度由最相似的原型确定,以在视频中寻找对应,称为文本自适应匹配。为学习用于表示视频中丰富信息的多样化原型,我们提出一种方差损失以鼓励不同原型关注视频的不同内容。我们的方法在四个公开视频检索数据集上优于最先进方法。

关键词

引用

@article{arxiv.2209.13307,
  title  = {Text-Adaptive Multiple Visual Prototype Matching for Video-Text Retrieval},
  author = {Chengzhi Lin and Ancong Wu and Junwei Liang and Jun Zhang and Wenhang Ge and Wei-Shi Zheng and Chunhua Shen},
  journal= {arXiv preprint arXiv:2209.13307},
  year   = {2022}
}

备注

NIPS2022