Explore-And-Match:用 Transformer 桥接基于提议与无提议的视频语句定位方法
计算机视觉与模式识别
2022-08-05 v4
摘要
自然语言视频定位(NLVG)旨在根据语句查询在未裁剪视频中定位时间段。本文提出一种名为 Explore-And-Match 的 NLVG 新范式,无缝统一了两类 NLVG 方法的优势:无提议与基于提议;前者探索搜索空间直接寻找时间段,后者将预定义时间段与真值相匹配。为此,我们将 NLVG 表述为集合预测问题,并设计了一个端到端可训练的语言视频 Transformer(LVTR),其具备两项有利特性:丰富的上下文建模能力与并行解码。我们用两种损失训练 LVTR。第一,时间定位损失使所有查询的时间段回归目标(探索)。第二,集合引导损失将每个查询与其各自目标耦合(匹配)。令人惊讶的是,我们发现训练过程呈现出类分而治之的模式:时间段先不顾目标被多样化,然后与每个目标耦合,再对目标进行微调。此外,LVTR 高效且有效:其推理速度比先前基线更快(2 倍或以上),并在两个 NLVG 基准(ActivityCaptions 和 Charades-STA)上取得了有竞争力的结果。代码见 https://github.com/sangminwoo/Explore-And-Match。
引用
@article{arxiv.2201.10168,
title = {Explore-And-Match: Bridging Proposal-Based and Proposal-Free With Transformer for Sentence Grounding in Videos},
author = {Sangmin Woo and Jinyoung Park and Inyong Koo and Sumin Lee and Minki Jeong and Changick Kim},
journal= {arXiv preprint arXiv:2201.10168},
year = {2022}
}
备注
Code: https://github.com/sangminwoo/Explore-And-Match