中文

LAVA:用于对比视频预训练的语言-音频-视觉对齐

计算机视觉与模式识别 2022-07-19 v1

摘要

生成视频数据的表示在推进机器感知领域方面至关重要。当前大多数技术依赖于人工标注数据,这类数据难以处理、生成成本高且难以扩展。在本工作中,我们提出一种基于对比学习的新型学习方法 LAVA,它能够以自监督方式学习联合的语言、音频和视频表示。我们在 Kinetics 700 数据集上使用 transformer 编码器对 LAVA 进行预训练,以学习每种模态的表示。随后我们证明,在使用一小部分无标签数据的情况下,LAVA 在 UCF-101 和 HMDB-51 视频动作识别上能与当前最先进的自监督和弱监督预训练技术相媲美。

关键词

引用

@article{arxiv.2207.08024,
  title  = {LAVA: Language Audio Vision Alignment for Contrastive Video Pre-Training},
  author = {Sumanth Gurram and Andy Fang and David Chan and John Canny},
  journal= {arXiv preprint arXiv:2207.08024},
  year   = {2022}
}

备注

Workshop Paper at ICML 2022