中文

基于物体证据与反向字幕生成的视频时刻定位

计算机视觉与模式识别 2020-06-19 v1 多媒体

摘要

我们解决了未剪辑视频中基于语言的时间时刻定位问题。与固定类别的时间定位相比,该问题更具挑战性,因为基于语言的查询没有预定义的活动类别,并且可能包含复杂描述。当前最先进的模型 MAC 通过从视频和语言两种模态中挖掘活动概念来解决该问题。该方法从语言查询中的动词/宾语对中编码语义活动概念,并利用视频活动分类预测分数中的视觉活动概念。我们提出“多面视频时刻定位器”(MML),它是 MAC 模型的扩展,通过物体分割掩码引入视觉物体证据,并通过视频字幕生成引入视频理解特征。此外,我们改进了句子嵌入中的语言建模。我们在 Charades-STA 数据集上进行了实验,发现 MML 在 R@1 和 R@5 指标上分别比 MAC 基线高出 4.93% 和 1.70%。我们的代码和预训练模型公开于 https://github.com/madhawav/MML。

关键词

引用

@article{arxiv.2006.10260,
  title  = {Video Moment Localization using Object Evidence and Reverse Captioning},
  author = {Madhawa Vidanapathirana and Supriya Pandhre and Sonia Raychaudhuri and Anjali Khurana},
  journal= {arXiv preprint arXiv:2006.10260},
  year   = {2020}
}

备注

7 pages. 6 figures. For source code, refer https://github.com/madhawav/MML