面向时间语言定位的关系感知视频阅读理解
计算机视觉与模式识别
2021-12-02 v3 计算与语言
摘要
视频中的时间语言定位旨在定位与给定查询语句相关的时间片段。以往方法将其视为边界回归任务或片段抽取任务。本文将时间语言定位形式化为视频阅读理解,并提出一种关系感知网络(RaNet)来解决该问题。该框架旨在借助由粗到细的选项-查询交互与选项-选项关系构建,从预定义答案集中选择一个视频时刻选项。提出一种选项-查询交互器,在句子-时刻和词元-时刻两个层面上同时匹配视觉与文本信息,从而实现由粗到细的跨模态交互。此外,通过利用图卷积引入一种新颖的多选项关系构建器,以捕获视频时刻选项之间的依赖关系,从而选出最佳选项。在ActivityNet-Captions、TACoS和Charades-STA上的大量实验证明了我们方法的有效性。代码已公开。
引用
@article{arxiv.2110.05717,
title = {Relation-aware Video Reading Comprehension for Temporal Language Grounding},
author = {Jialin Gao and Xin Sun and Mengmeng Xu and Xi Zhou and Bernard Ghanem},
journal= {arXiv preprint arXiv:2110.05717},
year = {2021}
}
备注
Accepted by EMNLP-21