中文

解锁强监督:通用音频预训练方法的数据中心研究

声音 2026-03-30 v1 人工智能 音频与语音处理

摘要

当前的音频预训练 seeks 学习面向广泛音频理解任务的统一表征,但其仍然碎片化,基本受限于对弱、噪声且规模受限标签的依赖。drawing lessons from vision 的 foundational pre-training blueprint,我们认为音频领域必须首先建立自己的大规模、强监督框架。我们引入一个新型的数据中心管道,利用高保真描述符创建 SOTA 质量的描述,并构建首个统一标签系统(UTS),该系统桥接了语音、音乐和环境声。随后我们对不同预训练目标在这些强源数据上的系统比较研究。我们的实验表明,数据质量和覆盖范围是性能的主要驱动因素,而目标选项决定下游任务的专门化。

关键词

引用

@article{arxiv.2603.25767,
  title  = {Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods},
  author = {Xuanru Zhou and Yiwen Shao and Wei-Cheng Tseng and Dong Yu},
  journal= {arXiv preprint arXiv:2603.25767},
  year   = {2026}
}

备注

Accepted to CVPR 2026