通用语音增强的训练目标、架构与数据质量重构
声音
2026-05-04 v2
摘要
通用语音增强(USE)旨在在多样化退化条件下恢复语音质量,同时保持信号保真度。尽管近期取得了进展,但训练目标选择、失真-感知权衡以及数据治理等关键挑战仍未解决。本文系统性地解决了这三个被忽视的问题。首先,我们重新审视了使用早期反射语音作为降混响目标的常规做法,发现其可能降低感知质量和下游语音识别性能。我们证明,时间偏移的无反射干净语音提供了更优的学习目标。其次,基于失真-感知权衡理论,我们提出了简单两阶段框架,在给定感知质量水平下实现最小失真。最后,我们分析了训练数据规模与质量之间的权衡,揭示在大规模未筛选语料上训练会限制模型性能,因为模型难以去除细微伪影。我们的方法在 URGENT 2025 non-blind test set 上实现了最先进的性能, exhibits strong language-agnostic generalization,能够有效改善 TTS 训练数据。模型权重已可在 https://huggingface.co/nvidia/RE-USE 下载。
引用
@article{arxiv.2603.02641,
title = {Rethinking Training Targets, Architectures and Data Quality for Universal Speech Enhancement},
author = {Szu-Wei Fu and Rong Chao and Xuesong Yang and Sung-Feng Huang and Ryandhimas E. Zezario and Rauf Nasretdinov and Ante Jukić and Yu Tsao and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2603.02641},
year = {2026}
}