中文

一种声音描述:探索提示模板和类别描述以增强零样本音频分类

声音 2024-09-23 v1 人工智能 音频与语音处理

摘要

通过对比学习训练的音频-文本模型提供了一种通过自然语言提示(例如“这是一个声音”后跟类别名称)执行音频分类的实用方法。在这项工作中,我们探索了用于零样本音频分类的替代提示模板,证明了存在性能更高的选项。首先,我们发现提示的格式会显著影响性能,因此简单地使用格式正确的类别标签提示模型,其性能可与优化的提示模板甚至提示集成相媲美。此外,我们研究通过以音频为中心的描述来补充类别标签。通过利用大型语言模型,我们生成优先考虑声音事件的声学特征以消除类别歧义的文本描述,而无需进行大量的提示工程。我们表明,使用类别描述进行提示可以在主要环境声音数据集上的零样本音频分类中取得最先进的结果。值得注意的是,该方法不需要额外的训练,并且完全保持零样本。

关键词

引用

@article{arxiv.2409.13676,
  title  = {A sound description: Exploring prompt templates and class descriptions to enhance zero-shot audio classification},
  author = {Michel Olvera and Paraskevas Stamatiadis and Slim Essid},
  journal= {arXiv preprint arXiv:2409.13676},
  year   = {2024}
}

备注

DCASE 2024 - 9th Workshop on Detection and Classification of Acoustic Scenes and Events, Oct 2024, Tokyo, Japan