利用大语言模型的声音属性知识增强零样本音频分类
声音
2024-07-22 v1 音频与语音处理
摘要
零样本音频分类旨在识别和分类模型在训练期间从未见过的声音类别。本文提出了一种利用自动生成的声音属性描述进行零样本音频分类的新方法。我们提出了一系列声音属性,并利用大语言模型的领域知识为每个类别生成详细的属性描述。与以往主要依赖类别标签或简单描述的工作相比,我们的方法侧重于多维的固有听觉属性,捕捉声音类别的不同特征。此外,我们结合了对比学习方法,以增强从文本标签进行的零样本学习。我们在VGGSound和AudioSet数据集上验证了该方法的有效性(代码可在https://www.github.com/wsntxxn/AttrEnhZsAc获取)。结果表明,我们的方法显著提高了零样本分类准确率。消融实验结果显示,无论模型架构如何,性能均有稳健提升。
引用
@article{arxiv.2407.14355,
title = {Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models},
author = {Xuenan Xu and Pingyue Zhang and Ming Yan and Ji Zhang and Mengyue Wu},
journal= {arXiv preprint arXiv:2407.14355},
year = {2024}
}
备注
Interspeech 2024