中文

论述音频-语言预训练以学习通用音频表征

音频与语音处理 2025-11-24 v1 人工智能

摘要

音频-语言预训练为通用音频理解提供了前景,但相较于其视觉对应方法仍属探索不足。虽然像CLIP这样的视觉-语言模型已成为广泛采用的基础模型,但现有的音频-语言模型主要在检索任务中表现出色,作为通用编码器的采用有限。我们识别出三个关键障碍:大规模音频-文本语料的不足、标题样本的不足以及缺乏系统化的探索和评估。为此,我们引入CaptionStew,一个聚合了来自多个领域和标题风格的开源音频-文本语料的1.07亿标题数据集。使用这一资源,我们进行了首次全面比较,对比对比学习和标题生成目标在语音、音乐和环境声任务中的音频表征学习效果。我们的结果表明,音频-语言预训练可获得具有竞争力且可迁移的表征。通过系统化的数据规模实验,我们揭示了不同目标的互补优势:对比学习在较小规模下实现更高的数据效率,而标题生成在涉及语言的音频理解任务中表现更好。我们还发现,常见的监督性初始化实践在规模化时收益递减,挑战了当前方法。这些发现确立了音频-语言预训练作为通用音频表征的可行路径,指导未来研究。为加快进度,我们发布了数据准备配方、训练协议和预训练模型,为通用音频理解铺平了道路。

关键词

引用

@article{arxiv.2511.16757,
  title  = {Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation},
  author = {Wei-Cheng Tseng and Xuanru Zhou and Mingyue Huo and Yiwen Shao and Hao Zhang and Dong Yu},
  journal= {arXiv preprint arXiv:2511.16757},
  year   = {2025}
}

备注

Work in progress