中文

用于音频恢复的扩散模型

音频与语音处理 2024-11-12 v3 机器学习 声音

摘要

随着音频播放设备和快速数据传输的发展,娱乐和通信对高音质的需求不断上升。在追求更好音质的过程中,来自录音端的失真和干扰或由不完美的传输管道引起的挑战不断出现。为了解决这个问题,音频恢复方法旨在从受损的输入数据中恢复干净的音频信号。我们在此提出基于扩散模型的音频恢复算法,重点关注语音增强和音乐恢复任务。基于手工规则和统计启发式的传统方法塑造了我们对音频信号的理解。在过去几十年中,出现了向利用 DNN 建模能力的数据驱动方法的显著转变。深度生成模型,其中包括扩散模型,已成为学习复杂数据分布的强大技术。然而,仅依赖基于 DNN 的学习方法带有降低可解释性的风险,特别是在使用端到端模型时。尽管如此,与基于统计模型的框架相比,数据驱动方法允许更大的灵活性,而后者的性能取决于难以保证的分布和统计假设。在这里,我们旨在表明扩散模型能够结合两者的优势,并提供了设计具有良好可解释性和在音质方面卓越性能的音频恢复算法的机会。我们解释了扩散形式体系及其在干净音频信号条件生成中的应用。我们相信扩散模型开辟了一个令人兴奋的研究领域,有可能催生出听感自然且在困难声学环境中保持鲁棒的新型音频恢复算法。

关键词

引用

@article{arxiv.2402.09821,
  title  = {Diffusion Models for Audio Restoration},
  author = {Jean-Marie Lemercier and Julius Richter and Simon Welker and Eloi Moliner and Vesa Välimäki and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2402.09821},
  year   = {2024}
}

备注

Currently in revision for IEEE Signal Processing Magazine Special Issue "Model-based and Data-Driven Audio Signal Processing"