当音频生成器成为优秀的倾听者:用于理解任务的生成式特征
声音
2025-09-30 v1
摘要
本工作开创性地利用生成式特征来增强音频理解。传统的判别式特征直接优化后验,从而强调语义抽象但丢失细粒度细节,与此不同,音频生成模型固有地编码了时空感知(跨时间和频率捕获局部声学纹理)和语义先验(知道要生成什么)。这促使我们探索这些互补优势之间的桥梁。我们系统地研究了它们的差异和互补关系,并最终提出了一种有效的融合策略。在多个任务上的实验,包括声音事件分类、标注,特别是音频描述这一细粒度任务,表现出一致的性能提升。除了经验性改进之外,本工作更重要的是引入了音频表示学习的新视角,强调生成式与判别式的互补性可以为音频理解提供详细的感知和语义意识。
引用
@article{arxiv.2509.24635,
title = {When Audio Generators Become Good Listeners: Generative Features for Understanding Tasks},
author = {Zeyu Xie and Chenxing Li and Xuenan Xu and Mengyue Wu and Wenfu Wang and Ruibo Fu and Meng Yu and Dong Yu and Yuexian Zou},
journal= {arXiv preprint arXiv:2509.24635},
year = {2025}
}