面向原型声音分类的音频-文本模型域适应方法与模态差异影响
声音
2025-06-06 v1 人工智能
音频与语音处理
摘要
音频-文本模型在零样图环境声分类中广泛应用,可减轻对标注数据的依赖。然而,我们发现在背景声源存在时,其性能会显著下降。我们的分析表明,这种性能下降主要由背景声景的信噪比(SNR)水平驱动,与背景类型无关。为解决此问题,我们提出了一种新方法,用于量化并整合背景声源在分类过程中的贡献,而无需重新训练模型。我们的域适应技术在各种背景和SNR条件下均能提升准确率。此外,我们分析了音频和文本嵌入之间的模态差异,表明缩小这一差异可改善分类性能。该方法在广泛的原型方法上具有良好的可扩展性和鲁棒性。
引用
@article{arxiv.2506.04376,
title = {Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification},
author = {Emiliano Acevedo and Martín Rocamora and Magdalena Fuentes},
journal= {arXiv preprint arXiv:2506.04376},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025