中文

利用辅助字幕进行视频定位

计算机视觉与模式识别 2024-03-26 v3

摘要

视频定位旨在从未剪辑的视频中定位与给定查询语句匹配的兴趣时刻。以往的工作忽略了视频标注中的稀疏性困境,这导致无法提供数据集中潜在事件与查询语句之间的上下文信息。在本文中,我们认为利用描述一般动作的易得字幕,即本文中定义的辅助字幕,将显著提升性能。为此,我们提出了一种用于视频定位的辅助字幕网络(ACNet)。具体而言,我们首先引入密集视频字幕生成来生成密集字幕,然后通过非辅助字幕抑制(NACS)获得辅助字幕。为了捕获辅助字幕中的潜在信息,我们提出了字幕引导注意力(CGA),将辅助字幕与查询语句之间的语义关系投射到时间空间中,并将其融合到视觉表示中。考虑到辅助字幕与真实值之间的差距,我们提出了非对称跨模态对比学习(ACCL),以构建更多负样本对,从而最大化跨模态互信息。在三个公开数据集(即ActivityNet Captions、TACoS和ActivityNet-CG)上的大量实验表明,我们的方法显著优于SOTA方法。

关键词

引用

@article{arxiv.2301.05997,
  title  = {Exploiting Auxiliary Caption for Video Grounding},
  author = {Hongxiang Li and Meng Cao and Xuxin Cheng and Zhihong Zhu and Yaowei Li and Yuexian Zou},
  journal= {arXiv preprint arXiv:2301.05997},
  year   = {2024}
}