中文

SMAUG:用于高效视频-语言预训练的稀疏掩码自编码器

计算机视觉与模式识别 2022-12-01 v3 人工智能 计算与语言

摘要

视频-语言预训练对于学习强大的多模态表示至关重要。然而,它通常需要大量的计算。在本文中,我们开发了 SMAUG,一个用于视频-语言模型的高效预训练框架。SMAUG 的基础组件是掩码自编码器。与先前仅对文本输入进行掩码的工作不同,我们的掩码策略同时考虑视觉和文本两种模态,提供了更好的跨模态对齐并节省了更多的预训练成本。在此基础上,我们引入了一个时空 token 稀疏化模块,利用上下文信息进一步仅为预训练选择“重要”的空间区域和时间帧。结合所有这些设计,我们的方法在文本到视频检索和视频问答任务上取得了具有竞争力的性能,同时将预训练成本降低了 1.9 倍或更多。例如,我们的 SMAUG 仅需约 50 个 NVIDIA A6000 GPU 小时进行预训练,即可在六个流行基准上的这两个视频-语言任务上获得具有竞争力的性能。

关键词

引用

@article{arxiv.2211.11446,
  title  = {SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-training},
  author = {Yuanze Lin and Chen Wei and Huiyu Wang and Alan Yuille and Cihang Xie},
  journal= {arXiv preprint arXiv:2211.11446},
  year   = {2022}
}