ArtiFree:检测并减少基于扩散的语音增强中的生成伪影
声音
2025-09-25 v1 人工智能
摘要
基于扩散的语音增强(SE)能实现自然听感的语音和强大的泛化能力,但仍存在生成伪影和高推理延迟等关键局限。本文系统研究了基于扩散的SE中的伪影预测与减少。我们表明,语音嵌入的方差可用于预测推理过程中的音素错误。基于这些发现,我们提出了一种由多次扩散运行间的语义一致性引导的集成推理方法。该技术在低信噪比条件下将词错误率(WER)降低了15%,有效提高了音素准确性和语义合理性。最后,我们分析了扩散步数的影响,表明自适应扩散步数能平衡伪影抑制与延迟。我们的发现突显了语义先验作为引导生成式SE实现无伪影输出的强大工具。
引用
@article{arxiv.2509.19495,
title = {ArtiFree: Detecting and Reducing Generative Artifacts in Diffusion-based Speech Enhancement},
author = {Bhawana Chhaglani and Yang Gao and Julius Richter and Xilin Li and Syavosh Zadissa and Tarun Pruthi and Andrew Lovitt},
journal= {arXiv preprint arXiv:2509.19495},
year = {2025}
}