中文

面向长视频的时间对齐网络

计算机视觉与模式识别 2022-04-07 v1

摘要

本文的目标是构建一个时间对齐网络,该网络接收长视频序列及关联文本句子,以用于:(1)判断句子是否可与视频对齐;以及(2)若可对齐,则确定其对齐位置。挑战在于从大规模数据集(如 HowTo100M)训练此类网络,其中关联文本句子具有显著噪声,且相关时仅为弱对齐。除提出对齐网络外,我们还做出四点贡献:(i)我们描述了一种新颖的协同训练方法,使其能够在无人工标注情况下对原始教学视频去噪并训练,尽管存在相当大的噪声;(ii)为基准测试对齐性能,我们人工整理了 HowTo100M 的一个 10 小时子集,共 80 个视频,带有稀疏时间描述。我们提出的模型在 HowTo100M 上训练,在该对齐数据集上以显著优势优于强基线(CLIP、MIL-NCE);(iii)我们将训练好的模型以零样本设置应用于多个下游视频理解任务并取得最先进结果,包括 YouCook2 上的文本-视频检索,以及 Breakfast-Action 上的弱监督视频动作分割;(iv)我们利用自动对齐的 HowTo100M 标注对骨干模型进行端到端微调,并在下游动作识别任务上获得改进性能。

关键词

引用

@article{arxiv.2204.02968,
  title  = {Temporal Alignment Networks for Long-term Video},
  author = {Tengda Han and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2204.02968},
  year   = {2022}
}

备注

CVPR2022 Oral, 16 pages