中文

ZeroSep:以零训练实现音频中的任意声源分离

声音 2025-05-30 v1 计算机视觉与模式识别 音频与语音处理

摘要

音频声源分离是机器理解复杂声学环境的基础,并支撑着众多音频应用。当前的监督深度学习方法虽然强大,但受限于对大量特定任务标注数据的需求,且难以泛化到真实世界声学场景的巨大变异性和开集特性。受生成式基础模型成功的启发,我们研究了预训练的文本引导音频扩散模型能否克服这些局限性。我们得出了一个令人惊讶的发现:在正确的配置下,纯粹通过预训练的文本引导音频扩散模型即可实现零样本声源分离。我们的方法命名为 ZeroSep,其工作原理是将混合音频反演到扩散模型的潜在空间中,然后利用文本条件引导去噪过程以恢复各个声源。无需任何特定任务的训练或微调,ZeroSep 将生成式扩散模型重新用于判别式分离任务,并通过其丰富的文本先验内在地支持开集场景。ZeroSep 兼容多种预训练的文本引导音频扩散骨干网络,并在多个分离基准测试中提供了强大的分离性能,甚至超越了监督方法。

关键词

引用

@article{arxiv.2505.23625,
  title  = {ZeroSep: Separate Anything in Audio with Zero Training},
  author = {Chao Huang and Yuesheng Ma and Junxuan Huang and Susan Liang and Yunlong Tang and Jing Bi and Wenqiang Liu and Nima Mesgarani and Chenliang Xu},
  journal= {arXiv preprint arXiv:2505.23625},
  year   = {2025}
}

备注

Project page: https://wikichao.github.io/ZeroSep/