面向时序句子定位的上下文感知双仿射定位网络
计算机视觉与模式识别
2021-03-23 v1
摘要
本文解决时序句子定位(TSG)问题,其旨在依据句子查询从未经裁剪的视频中识别特定片段的时间边界。先前工作要么比较预定义候选片段与查询并通过排序选择最佳者,要么直接回归目标片段的边界时间戳。本文中,我们提出一种新颖的定位框架,利用双仿射机制同时对视频内所有起止索引对进行打分。特别地,我们提出上下文感知双仿射定位网络(CBLN),其将局部与全局上下文均融入每个起止位置的特征中以用于基于双仿射的定位。来自相邻帧的局部上下文有助于区分视觉上相似的外观,而来自整个视频的全局上下文有助于推理时间关系。此外,我们还开发了多模态自注意力模块,为该双仿射策略提供细粒度的查询引导视频表示。大量实验表明,我们的 CBLN 在三个公开数据集(ActivityNet Captions、TACoS 和 Charades-STA)上显著优于最先进方法,证明了所提定位框架的有效性。
引用
@article{arxiv.2103.11555,
title = {Context-aware Biaffine Localizing Network for Temporal Sentence Grounding},
author = {Daizong Liu and Xiaoye Qu and Jianfeng Dong and Pan Zhou and Yu Cheng and Wei Wei and Zichuan Xu and Yulai Xie},
journal= {arXiv preprint arXiv:2103.11555},
year = {2021}
}
备注
Accepted by CVPR 2021