TSPE:面向提高零样本音频分类的任务特定提示集合
声音
2025-04-04 v2 人工智能
计算与语言
机器学习
音频与语音处理
摘要
音频-语言模型 (ALM) 在零样本音频分类中表现突出,这是一种在测试时对先前未见过的音频片段进行分类,通过利用描述性自然语言提示来实现。我们提出了 TSPE (Task-Specific Prompt Ensemble),这是一种简单且无需训练的硬提示方法,通过为不同音频分类任务定制提示来提升 ALM 的零样本性能。我们不使用基于通用模板的提示(如 "Sound of a car"),而是生成富含上下文的提示,例如 "Sound of a car coming from a tunnel"。具体而言,我们利用标签信息识别合适的声学属性(如 "loud" 和 "feeble"),以及合适的声源(如 "tunnel" 和 "street"),并将其纳入由 Audio-Language Models (ALM) 用于音频分类的提示中。进一步地,通过在 TSPE 生成的任务特定提示上进行提示集合,以增强音频-文本对齐。我们在 12 个多样化的音频分类数据集上进行评估,TSPE 在各种 ALM 上均实现了显著提升,相对于 vanilla 零样本评估,实现 1.23%~16.36% 的绝对性能提升。
引用
@article{arxiv.2501.00398,
title = {TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification},
author = {Nishit Anand and Ashish Seth and Ramani Duraiswami and Dinesh Manocha},
journal= {arXiv preprint arXiv:2501.00398},
year = {2025}
}
备注
Accepted to SALMA Workshop ICASSP 2025