ViGT:基于 Transformer 中可学习令牌的无候选视频定位
计算机视觉与模式识别
2023-08-14 v1 多媒体
摘要
视频定位(VG)任务旨在根据丰富的语言描述在未裁剪视频中定位所查询的动作或事件。现有的无候选方法陷入视频与查询之间复杂的交互,过度强调跨模态特征融合与特征关联以实现 VG。本文提出一种新颖的边界回归范式,在 Transformer 中执行回归令牌学习。具体而言,我们提出一个简洁而有效的无候选框架,即视频定位 Transformer(ViGT),其使用可学习的回归令牌而非多模态或跨模态特征来预测时间边界。在 ViGT 中,可学习令牌的优势体现如下:(1)该令牌与视频或查询无关,避免了针对原始视频和查询的数据偏置。(2)该令牌同时从视频和查询特征中进行全局上下文聚合。首先,我们采用共享特征编码器将视频和查询投影到联合特征空间,再执行跨模态协同注意力(即视频到查询注意力和查询到视频注意力)以突出各模态中的判别性特征。此外,我们将可学习回归令牌 [REG] 与视频和查询特征拼接作为视觉-语言 Transformer 的输入。最后,我们利用令牌 [REG] 预测目标片段,并利用视觉特征约束每个时间戳的前景与背景概率。所提出的 ViGT 在三个公开数据集 ANet Captions、TACoS 和 YouCookII 上表现良好。大量消融实验与定性分析进一步验证了 ViGT 的可解释性。
引用
@article{arxiv.2308.06009,
title = {ViGT: Proposal-free Video Grounding with Learnable Token in Transformer},
author = {Kun Li and Dan Guo and Meng Wang},
journal= {arXiv preprint arXiv:2308.06009},
year = {2023}
}
备注
This paper has been accepted by SCIENCE CHINA Information Sciences