用于视频时序语言定位的细粒度迭代注意力网络
计算机视觉与模式识别
2020-08-07 v1
摘要
视频中的时序语言定位旨在根据给定句子查询在未裁剪视频中定位一个视频片段。为应对该任务,设计有效模型以从视觉与文本两种模态中提取定位信息至关重要。然而,该领域以往多数尝试仅关注从视频到查询的单向交互,强调听取哪些词并通过原始软注意力关注句子信息,却未考虑由查询到视频交互所隐含的“看哪里”线索。本文提出一种细粒度迭代注意力网络(FIAN),其包含用于双向查询-视频信息提取的迭代注意力模块。具体而言,在迭代注意力模块中,查询中的每个词首先通过细粒度注意力关注视频中的每一帧得到增强,随后视频迭代地关注整合后的查询。最终,视频与查询信息均被利用,为进一步的时刻定位提供鲁棒的跨模态表示。此外,为更好地预测目标片段,我们提出一种面向内容的定位策略,而非采用近期基于锚点的定位。我们在三个具有挑战性的公开基准(ActivityNet Captions、TACoS 和 Charades-STA)上评估所提方法。FIAN 显著优于当前最先进的方法。
引用
@article{arxiv.2008.02448,
title = {Fine-grained Iterative Attention Network for TemporalLanguage Localization in Videos},
author = {Xiaoye Qu and Pengwei Tang and Zhikang Zhou and Yu Cheng and Jianfeng Dong and Pan Zhou},
journal= {arXiv preprint arXiv:2008.02448},
year = {2020}
}
备注
ACM MM 2020