用于时间定位的局部-全局视频-文本交互
计算机视觉与模式识别
2020-04-17 v1
摘要
本文研究文本到视频的时间定位问题,旨在识别视频中与文本查询语义相关的时间区间。我们使用一种新颖的基于回归的模型来解决该问题,该模型学习为文本查询中的语义短语提取一组中间层特征,这些短语对应于查询中描述的重要语义实体(例如演员、物体与动作),并在多个层次上反映查询的语言特征与视频的视觉特征之间的双模态交互。所提方法通过在双模态交互中利用从局部到全局的上下文信息,有效预测目标时间区间。通过深入的消融研究,我们发现将视频与文本交互中的局部与全局上下文结合对精准定位至关重要。我们的实验表明,所提方法在 Charades-STA 与 ActivityNet Captions 数据集上以较大优势超越 SOTA,在 Recall@tIoU=0.5 指标上分别高出 7.44% 与 4.61% 个百分点。代码见 https://github.com/JonghwanMun/LGI4temporalgrounding。
引用
@article{arxiv.2004.07514,
title = {Local-Global Video-Text Interactions for Temporal Grounding},
author = {Jonghwan Mun and Minsu Cho and Bohyung Han},
journal= {arXiv preprint arXiv:2004.07514},
year = {2020}
}
备注
CVPR 2020; code available in https://github.com/JonghwanMun/LGI4temporalgrounding