中文

重新审视视频-语言理解中的“视频”

计算机视觉与模式识别 2022-06-06 v1 人工智能 计算与语言 机器学习

摘要

除了从单幅图像所能理解的内容之外,是什么使视频任务独特地适合于视频?基于自监督图像-语言模型的最新进展,我们在视频与语言任务的背景下重新审视这一问题。我们提出了时间无关探针(ATP),一种用于视频-语言分析的新模型,它为受图像级理解约束的多模态模型提供了更强的基线精度界限。通过将此模型应用于标准的判别式视频与语言任务(如视频问答和文本到视频检索),我们刻画了当前视频-语言基准的局限性与潜力。我们发现,事件时间性的理解往往并非取得强劲或最先进性能所必需,即便与近期大规模视频-语言模型相比,或在旨在基准更深视频级理解的语境中亦如此。我们还展示了 ATP 如何改进视频-语言数据集与模型设计。我们描述了一种利用 ATP 更好地解耦具有更高时间挑战性数据浓度的数据集子集的技术,从而提升因果与时间理解的基准效能。此外,我们展示了将 ATP 有效整合进完整视频级时间模型可提升效率与最先进精度。

关键词

引用

@article{arxiv.2206.01720,
  title  = {Revisiting the "Video" in Video-Language Understanding},
  author = {Shyamal Buch and Cristóbal Eyzaguirre and Adrien Gaidon and Jiajun Wu and Li Fei-Fei and Juan Carlos Niebles},
  journal= {arXiv preprint arXiv:2206.01720},
  year   = {2022}
}

备注

CVPR 2022 (Oral)