将视频理解视为机器翻译
计算机视觉与模式识别
2020-09-21 v2
摘要
随着大规模多模态视频数据集(尤其是带有音频或转写语音的序列)的出现,对视频表征自监督学习的兴趣日益增长。多数先前工作将目标表述为模态间的对比度量学习问题。然而,为实现有效学习,这些策略需要对正负样本进行仔细筛选,并常结合手工设计的课程策略。本工作中,我们通过采用生成式建模方法消除了负采样需求,该方法将目标表述为模态间的翻译问题。此种表述使我们能够通过单一统一框架处理多种下游视频理解任务,而无需对比度量学习中常见的大批量负样本。我们使用大规模HowTo100M数据集进行训练,并在若干下游任务上报告了相对于最先进方法的性能提升,包括视频分类(EPIC-Kitchens)、问答(TVQA)、字幕生成(TVC、YouCook2与MSR-VTT)以及基于文本的片段检索(YouCook2与MSR-VTT)。
引用
@article{arxiv.2006.07203,
title = {Video Understanding as Machine Translation},
author = {Bruno Korbar and Fabio Petroni and Rohit Girdhar and Lorenzo Torresani},
journal= {arXiv preprint arXiv:2006.07203},
year = {2020}
}
备注
The authors have temporarily withdrawn this paper to reassess some of the experimental results