中文

无大规模音频预训练的视觉模型参数高效旁适配器

声音 2024-12-10 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

最近的研究表明,预训练视觉模型可提升音频下游任务的性能。为进一步提升性能,通常需要使用大规模音频数据进行额外的预训练,以将音频特定知识注入视觉模型。然而,这些方法需要大量音频数据和精心设计的目标函数。本文提出绕过预训练阶段,直接通过我们设计的高效音频理解 Look Aside Adapter(LoAA) 对视觉模型进行微调。音频频谱数据在两个异构维度(时间和频率)上表示,我们细化适配器以促进这些维度之间令牌的相互作用。我们的实验表明,所述适配器使视觉模型在各种音频和语音任务中达到或超越预训练音频模型的性能,为在音频应用中利用视觉模型提供了一种资源高效且有效的解决方案。

关键词

引用

@article{arxiv.2412.05951,
  title  = {When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining},
  author = {Juan Yeo and Jinkwan Jang and Kyubyung Chae and Seongkyu Mun and Taesup Kim},
  journal= {arXiv preprint arXiv:2412.05951},
  year   = {2024}
}

备注

5 pages, 3 figures