将语言-音频模型适配为少样本音频学习器
音频与语音处理
2023-05-30 v1 声音
摘要
我们提出了 Treff 适配器,一种用于 CLAP 的训练高效适配器,通过利用少量标注数据来提升零样本分类性能。具体而言,我们设计了 CALM,使用一组音频-标签对来检索文本-音频片段在各类别上的概率分布,并将其与 CLAP 的零样本分类结果相结合。此外,我们通过将 CALM 用作余弦相似度度量,设计了 Treff 适配器的免训练版本。实验表明,所提 Treff 适配器在低样本和数据充足场景下可与全监督方法及适配方法相媲美甚至更优。尽管 Treff 适配器表明,将大规模预训练与领域特定知识的快速学习相结合对于获取少样本学习的通用表征并非易事,其仍局限于音频分类任务。未来,我们将探索如何在多样化音频领域中使用音频-语言模型。
引用
@article{arxiv.2305.17719,
title = {Adapting Language-Audio Models as Few-Shot Audio Learners},
author = {Jinhua Liang and Xubo Liu and Haohe Liu and Huy Phan and Emmanouil Benetos and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2305.17719},
year = {2023}
}