中文

DiT-Flow: 基于潜在空间流匹配和扩散转换器的面向多种失真的语音增强

音频与语音处理 2026-03-24 v1 人工智能 声音

摘要

近期发展表明,扩散模型和流匹配模型在音频任务中展现出强大的性能。然而,语音增强(SE)模型通常在有限数据集上训练,并在狭窄条件下评估,限制了其实际应用。为此,我们提出DiT-Flow,这是一种基于潜在扩散转换器(DiT)主干网络构建的、针对多种失真(包括噪声、混响和压缩)进行鲁棒性训练的语音增强框架。DiT-Flow operates on compact variational auto-encoders(VAEs)-derived latent features。我们在StillSonicSet上验证了该方法,该数据集由LibriSpeech、FSD50K、FMA和90个Matterport3D场景组成。实验表明,DiT-Flow consistently优于最新的生成式SE模型,证明了流匹配在多条件语音增强中的有效性。尽管不断努力以提高合成数据逼真度,但SE的持续瓶颈是训练与部署条件之间的不可避免不匹配。通过将LoRA与MoE框架集成,我们实现了DiT-Flow在仅使用总参数4.9%的情况下,针对五个未见失真获得更好的性能。

关键词

引用

@article{arxiv.2603.21608,
  title  = {DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers},
  author = {Tianyu Cao and Helin Wang and Ari Frummer and Yuval Sieradzki and Adi Arbel and Laureano Moro Velazquez and Jesus Villalba and Oren Gal and Thomas Thebaud and Najim Dehak},
  journal= {arXiv preprint arXiv:2603.21608},
  year   = {2026}
}