中文

论面向视频定位的多模态 Transformer 设计

计算机视觉与模式识别 2022-04-12 v2 计算与语言

摘要

视频定位旨在从未经裁剪的视频中定位与句子查询相对应的时间片段。几乎所有现有的视频定位方法都落入两种框架:1)自顶向下模型:它预定义一组片段候选,然后进行片段分类与回归。2)自底向上模型:它直接预测参考片段边界的逐帧概率。然而,这些方法均非端到端,即它们总是依赖某些耗时的后处理步骤来精化预测。为此,我们将视频定位重新表述为一个集合预测任务,并提出一种新颖的端到端多模态 Transformer 模型,称为 GTR。具体而言,GTR 具有用于视频与语言编码的两个编码器,以及用于定位预测的交叉模态解码器。为促进端到端训练,我们使用 Cubic Embedding 层将原始视频转换为一组视觉 token。为在解码器中更好地融合这两种模态,我们设计了一种新的多头交叉模态注意力(Multi-head Cross-Modal Attention)。整个 GTR 通过多对一匹配损失进行优化。此外,我们进行了全面研究以探究不同的模型设计选择。在三个基准上的广泛结果验证了 GTR 的优越性。所有三种典型 GTR 变体在所有数据集与指标上均取得了破纪录的性能,且推理速度快数倍。

关键词

引用

@article{arxiv.2109.06085,
  title  = {On Pursuit of Designing Multi-modal Transformer for Video Grounding},
  author = {Meng Cao and Long Chen and Mike Zheng Shou and Can Zhang and Yuexian Zou},
  journal= {arXiv preprint arXiv:2109.06085},
  year   = {2022}
}

备注

Accepted by Conference on Empirical Methods in Natural Language Processing (EMNLP 2021, Oral)