中文

PAT:无参数音频-文本对齐器提升零样态音频分类

声音 2024-10-22 v1 音频与语音处理

摘要

音频-语言模型 (ALMs) 在零样态音频分类中展现出卓越的性能。本文介绍了 PAT (Parameter-free Audio-Text aligner),一种简单且无需训练的方法,旨在提升基于 CLAP 类 ALMs 的零样态音频分类性能。为实现此目标,我们提出通过增强双模态表示来改进音频与语言模态之间的跨模态交互。具体而言,为增强文本表示,我们提出了提示集合算法,自动从包含大量手工提示的数据存储库中选择并组合与音频最相关的提示,并根据其与音频的相关性对其进行加权。在另一方面,为增强音频表示,我们基于增强后的文本信息重新加权帧级音频特征。我们提出的方法不需要任何额外模块或参数,可与任何现有的 CLAP 类 ALM 结合使用,以提高零样态音频分类性能。我们在 18 个多样化基准数据集和 6 个 ALMs 上进行实验,表明 PAT 在 vanilla 零样态评估上以显著的 0.42%-27.0% 的优势表现。此外,我们证明 PAT 即使在输入音频受到不同程度噪声降解时,仍能保持稳健的性能。我们的代码将在接受后开源。

关键词

引用

@article{arxiv.2410.15062,
  title  = {PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification},
  author = {Ashish Seth and Ramaneswaran Selvakumar and Sonal Kumar and Sreyan Ghosh and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2410.15062},
  year   = {2024}
}

备注

18 pages