中文

面向原型声音分类的音频-文本模型域适应方法与模态差异影响

声音 2025-06-06 v1 人工智能 音频与语音处理

摘要

音频-文本模型在零样图环境声分类中广泛应用,可减轻对标注数据的依赖。然而,我们发现在背景声源存在时,其性能会显著下降。我们的分析表明,这种性能下降主要由背景声景的信噪比(SNR)水平驱动,与背景类型无关。为解决此问题,我们提出了一种新方法,用于量化并整合背景声源在分类过程中的贡献,而无需重新训练模型。我们的域适应技术在各种背景和SNR条件下均能提升准确率。此外,我们分析了音频和文本嵌入之间的模态差异,表明缩小这一差异可改善分类性能。该方法在广泛的原型方法上具有良好的可扩展性和鲁棒性。

关键词

引用

@article{arxiv.2506.04376,
  title  = {Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification},
  author = {Emiliano Acevedo and Martín Rocamora and Magdalena Fuentes},
  journal= {arXiv preprint arXiv:2506.04376},
  year   = {2025}
}

备注

Accepted at INTERSPEECH 2025