基于扩散的语音修复实现瞬态噪声去除
音频与语音处理
2025-08-13 v1 声音
摘要
本文提出了 PGDI,一个基于扩散的语音修复框架,用于恢复缺失或严重损坏的语音片段。与先前难以应对说话人可变性或长间隙长度的方法不同,PGDI 能够精确重建长达一秒的间隙,同时保留说话人身份、韵律以及混响等环境因素。该方法的核心是分类器引导,特别是音素级引导,这显著提高了重建的保真度。PGDI 以与说话人无关的方式运行,并且即使长片段被强烈的瞬态噪声(如烟花、关门声、锤击声和施工噪声)完全掩盖,也能保持鲁棒性,使其非常适合现实世界的应用。通过在多种说话人和不同间隙长度上进行广泛实验,我们展示了 PGDI 优越的修复性能及其处理复杂声学条件的能力。我们考虑了推理时有无文本转录的两种场景,结果表明,虽然文本的可用性可以进一步提升性能,但即使没有文本,模型依然有效。音频样本请访问:https://mordehaym.github.io/PGDI/
引用
@article{arxiv.2508.08890,
title = {Transient Noise Removal via Diffusion-based Speech Inpainting},
author = {Mordehay Moradi and Sharon Gannot},
journal= {arXiv preprint arXiv:2508.08890},
year = {2025}
}
备注
23 pages, 3 figures, signal processing paper on speech inpainting