DiTSE:基于潜在扩散Transformer的高保真生成语音增强
音频与语音处理
2025-09-22 v2 声音
摘要
现实语音录音常受背景噪声和混响等退化影响。语音增强旨在通过生成干净的高保真信号来缓解这些问题。尽管近期的生成方法对于语音增强显示出有前景的成果,但仍面临两个主要挑战:(1)内容幻觉,即生成的 plausible 音节与原始语音不同;以及(2)不一致性,未能保留输入语音的说话人身份和修辞特征。在本工作中,我们引入DiTSE(Diffusion Transformer for Speech Enhancement),以解决降级语音的质量问题。我们的方案采用潜在扩散Transformer模型,结合稳健的条件特征,有效解决了这些挑战,同时保持计算效率。来自主观和客观评估的实验结果表明,DiTSE实现了最先进的音频质量,首次匹配来自DAPS数据集的真实录音室质量的音频。此外,DiTSE显著改善了说话人身份和内容保真度的保留,减少了相对于最先进的增强器的幻觉现象。音频样本可在:http://hguimaraes.me/DiTSE 获取。
引用
@article{arxiv.2504.09381,
title = {DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers},
author = {Heitor R. Guimarães and Jiaqi Su and Rithesh Kumar and Tiago H. Falk and Zeyu Jin},
journal= {arXiv preprint arXiv:2504.09381},
year = {2025}
}
备注
Manuscript under review