中文

视觉 Transformer 是参数高效的音视频学习器

计算机视觉与模式识别 2023-04-06 v2 计算与语言 机器学习 声音 音频与语音处理

摘要

视觉 Transformer(ViTs)在过去几年中于各类计算机视觉任务上取得了令人印象深刻的成果。在本工作中,我们研究了仅在视觉数据上预训练的冻结 ViTs 在不微调任何原始参数的情况下泛化到音视频数据的能力。为此,我们提出了一种潜在音视频混合(LAVISH)适配器,通过将少量可训练参数注入冻结 ViT 的每一层,使预训练 ViTs 适应音视频任务。为高效融合视觉与音频线索,我们的 LAVISH 适配器使用一小组潜在 token,其构成注意力瓶颈,从而消除了标准交叉注意力的二次代价。与现有的模态特定音视频方法相比,我们的方法在各种音视频任务上取得了有竞争力甚至更优的性能,同时使用了更少的可调参数,且不依赖昂贵的音频预训练或外部音频编码器。我们的代码见 https://genjib.github.io/project_page/LAVISH/

关键词

引用

@article{arxiv.2212.07983,
  title  = {Vision Transformers are Parameter-Efficient Audio-Visual Learners},
  author = {Yan-Bo Lin and Yi-Lin Sung and Jie Lei and Mohit Bansal and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2212.07983},
  year   = {2023}
}

备注

CVPR 2023 Project Page: https://genjib.github.io/project_page/LAVISH/