中文

Siamese Vision Transformers 是可扩展的音视频学习器

计算机视觉与模式识别 2024-03-29 v1 声音 音频与语音处理

摘要

传统的音视频方法依赖独立的音频和视觉骨干网络,这成本高昂且不可扩展。在本工作中,我们研究使用音视频孪生网络(AVSiam)进行高效且可扩展的音视频预训练。我们的框架使用单一共享的 vision transformer 骨干网络来处理音频和视觉输入,提高了其参数效率,减少了 GPU 内存占用,并允许我们将方法扩展到更大的数据集和模型尺寸。我们使用具有多比例随机掩码方案的对比音视频匹配目标来预训练我们的模型,这使得我们的模型能够处理更大的音视频实例批次,这对对比学习很有帮助。与先前的音视频方法不同,我们的方法能够使用单一共享的 ViT 骨干网络稳健地处理音频、视觉和音视频输入。此外,尽管两种模态使用了共享骨干网络,AVSiam 在 AudioSet 和 VGGSound 上的音视频分类和检索任务中取得了与先前方法相当甚至更好的结果。我们的代码可在 https://github.com/GenjiB/AVSiam 获取

关键词

引用

@article{arxiv.2403.19638,
  title  = {Siamese Vision Transformers are Scalable Audio-visual Learners},
  author = {Yan-Bo Lin and Gedas Bertasius},
  journal= {arXiv preprint arXiv:2403.19638},
  year   = {2024}
}