中文

一种基于跨模态注意力的简洁而有效的视频时间定位方法

计算机视觉与模式识别 2020-09-24 v1

摘要

语言引导的视频时间定位任务是在未裁剪视频中定位与查询语句对应的特定视频片段。尽管该领域持续取得进展,仍有一些问题有待解决。首先,现有多数方法依赖多个复杂模块的组合来完成任务。其次,由于两种不同模态间的语义鸿沟,在视频与语言间对齐不同粒度(局部与全局)的信息十分重要,但较少被关注。最后,先前工作未考虑由动作边界模糊性导致的不可避免的标注偏差。为应对这些局限,我们提出了一种结构直观简洁的双分支跨模态注意力(CMA)模块,其交替调制两种模态以更好地在局部与全局上匹配信息。此外,我们引入了一种新的任务特定回归损失函数,通过减轻标注偏差的影响来提升时间定位精度。我们进行了大量实验验证所提方法,结果表明仅用这一简洁模型,便可在 Charades-STA 与 ActivityNet Captions 数据集上超越当前最优方法(SOTA)。

关键词

引用

@article{arxiv.2009.11232,
  title  = {A Simple Yet Effective Method for Video Temporal Grounding with Cross-Modality Attention},
  author = {Binjie Zhang and Yu Li and Chun Yuan and Dejing Xu and Pin Jiang and Ying Shan},
  journal= {arXiv preprint arXiv:2009.11232},
  year   = {2020}
}

备注

9 pages