中文

解放自然音频的力量:面向多声源场景

声音 2025-04-25 v1 机器学习

摘要

通用声源分离旨在从混合音频中提取对应于不同事件的干净音轨,这对于人工听觉感知至关重要。然而,当前方法依赖人工混合音频进行训练,限制了其在实际环境中收集的自然混合音频上的泛化能力。为克服这一限制,我们提出了 ClearSep 框架,该框架运用数据引擎将复杂的自然混合音频分解为多个独立的音轨,从而允许在实际场景中实现有效的声源分离。我们引入两种基于 remix 的评估指标来定量评估分离质量,并将这些指标作为阈值,迭代地应用数据引擎和模型训练,逐步优化分离性能。此外,我们提出了一系列针对这些分离出的独立音轨的训练策略,以充分利用它们。大量实验表明,ClearSep 在多个声源分离任务上实现了最先进的性能,凸显了其在自然音频场景中推动声源分离发展的潜力。欲了解更多示例和详细结果,请访问我们的演示页面 https://clearsep.github.io。

关键词

引用

@article{arxiv.2504.17782,
  title  = {Unleashing the Power of Natural Audio Featuring Multiple Sound Sources},
  author = {Xize Cheng and Slytherin Wang and Zehan Wang and Rongjie Huang and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2504.17782},
  year   = {2025}
}

备注

Work in Progress