中文

面向语言-音频模型的免音频提示微调

音频与语音处理 2023-09-18 v1 声音

摘要

对比语言-音频预训练(CLAP)经过预训练以将音频特征与人类语言相关联,使其成为识别未知声音类别的自然零样本分类器。为使CLAP适应下游任务,已有工作不可避免地需要标注的领域音频,这限制了其在数据稀缺下的可扩展性,并剥夺了它们像原始CLAP那样检测新类别的能力。本工作中,通过利用CLAP中的模态对齐,我们提出了一种高效的免音频提示微调方案,旨在从文本而非音频优化少量提示词元,这同时也正则化模型空间以避免对所见类别的过拟合。在此基础上,进一步探索了多粒度提示设计以融合全局与局部信息。在多个任务上的实验表明,我们的方法能够提升CLAP,并在模型性能和训练效率上优于其他训练方法。在对未见类别进行零样本推断时,它仍展现出比原始CLAP更好的可迁移性。此外,即便仅知晓下游类别名称,我们的方法也足够灵活。代码将很快发布。

关键词

引用

@article{arxiv.2309.08357,
  title  = {Audio-free Prompt Tuning for Language-Audio Models},
  author = {Yiming Li and Xiangdong Wang and Hong Liu},
  journal= {arXiv preprint arXiv:2309.08357},
  year   = {2023}
}

备注

submitted to ICASSP 2024