解锁强监督:通用音频预训练方法的数据中心研究
声音
2026-03-30 v1 人工智能
音频与语音处理
摘要
当前的音频预训练 seeks 学习面向广泛音频理解任务的统一表征,但其仍然碎片化,基本受限于对弱、噪声且规模受限标签的依赖。drawing lessons from vision 的 foundational pre-training blueprint,我们认为音频领域必须首先建立自己的大规模、强监督框架。我们引入一个新型的数据中心管道,利用高保真描述符创建 SOTA 质量的描述,并构建首个统一标签系统(UTS),该系统桥接了语音、音乐和环境声。随后我们对不同预训练目标在这些强源数据上的系统比较研究。我们的实验表明,数据质量和覆盖范围是性能的主要驱动因素,而目标选项决定下游任务的专门化。
引用
@article{arxiv.2603.25767,
title = {Unlocking Strong Supervision: A Data-Centric Study of General-Purpose Audio Pre-Training Methods},
author = {Xuanru Zhou and Yiwen Shao and Wei-Cheng Tseng and Dong Yu},
journal= {arXiv preprint arXiv:2603.25767},
year = {2026}
}
备注
Accepted to CVPR 2026