中文

面向跨模态视频检索的模态掩码方法

计算机视觉与模式识别 2021-11-04 v2

摘要

在大规模无标注数据集上的预训练已在计算机视觉和自然语言处理领域展现出显著的性能提升。随着大规模教学视频数据集的出现,预训练视频编码器的常用策略是利用 accompanying speech 作为弱监督。然而,由于语音被用于监督预训练,视频编码器从未见过语音,因而无法学习处理该模态。我们针对当前预训练方法未能利用口语中丰富线索的这一缺陷,提出使用所有可用视频模态作为监督来预训练视频编码器,即外观、声音和转写语音。我们在输入中掩码掉整个模态,并利用其余两个模态对其进行预测。这促使各模态相互协作,使我们的视频编码器学会处理外观、音频以及语音。我们在 How2R、YouCook2 和 Condensed Movies 数据集上展示了我们的“模态掩码”预训练方法在视频检索上的优越性能。

关键词

引用

@article{arxiv.2111.01300,
  title  = {Masking Modalities for Cross-modal Video Retrieval},
  author = {Valentin Gabeur and Arsha Nagrani and Chen Sun and Karteek Alahari and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2111.01300},
  year   = {2021}
}

备注

Accepted at WACV 2022