用于视频表示学习的参数高效多模态 Transformer
计算机视觉与模式识别
2021-09-23 v2
摘要
Transformer 在语言领域的近期成功促使人们将其适配到多模态场景中,即同时训练一个新的视觉模型与一个已预训练的语言模型。然而,由于 Transformer 对内存的过度需求,现有工作通常固定语言模型而仅训练视觉模块,这限制了其以端到端方式学习跨模态信息的能力。在本工作中,我们致力于在视听视频表示学习的背景下减少多模态 Transformer 的参数。我们通过跨层和跨模态共享 Transformer 的参数来缓解高内存需求;我们将 Transformer 分解为模态特定部分和模态共享部分,使得模型既能单独又能共同学习各模态的动态,并提出了一种基于低秩近似的全新参数共享方案。我们表明,我们的方法可将 Transformer 的参数减少高达 97%,使我们能够从头开始端到端地训练模型。我们还提出了一种负采样方法,该方法基于在 CNN 嵌入空间中测量的实例相似性,该空间由我们的模型与 Transformer 共同学习。为了展示我们的方法,我们在 Kinetics-700 的 30 秒片段(480 帧)上预训练我们的模型,并将其迁移到视听分类任务中。
引用
@article{arxiv.2012.04124,
title = {Parameter Efficient Multimodal Transformers for Video Representation Learning},
author = {Sangho Lee and Youngjae Yu and Gunhee Kim and Thomas Breuel and Jan Kautz and Yale Song},
journal= {arXiv preprint arXiv:2012.04124},
year = {2021}
}
备注
Accepted to ICLR 2021