中文

基于扩散模型的音频修复

音频与语音处理 2025-01-13 v3 声音

摘要

音频修复旨在重建受损录音中的缺失片段。现有多数方法在缺口较短时能生成合理的重建结果,但难以重建长于约 100 ms 的缺口。本文探索深度学习尤其是扩散模型在音频修复任务中的最新进展。所提方法使用一个无条件训练的生成模型,该模型可以零样本方式条件化用于音频修复,并能够重建任意大小的缺口。我们还提出了一种基于常数 Q 变换的改进深度神经网络架构,使模型能够利用音频中的音高等变对称性。所提算法的性能通过客观与主观指标在重建短至中等缺口(最长 300 ms)的任务上进行了评估。一项正式听测的结果表明,对于 50 ms 等短缺口,所提方法与对比基线性能相当,同时保持良好的音频质量,并在最长 300 ms 的更宽缺口上优于基线。本文方法可应用于修复遭受严重局部干扰或信号丢失而必须重建的录音。

关键词

引用

@article{arxiv.2305.15266,
  title  = {Diffusion-Based Audio Inpainting},
  author = {Eloi Moliner and Vesa Välimäki},
  journal= {arXiv preprint arXiv:2305.15266},
  year   = {2025}
}

备注

Submitted for publication to the Journal of Audio Engineering Society on January 30th, 2023