FUSE:使用稀疏压缩与 Token 生成模型多阶段融合的通用语音增强(面向 URGENT 2025 挑战赛)
声音
2025-06-03 v1 音频与语音处理
摘要
我们提出了一种用于通用语音增强的多阶段框架,专为 Interspeech 2025 URGENT 挑战赛设计。我们的系统首先采用稀疏压缩网络,从含噪输入中稳健地分离声源并提取初始的纯净语音估计。随后使用一个高效的生成模型,通过利用自监督特征并优化基于神经音频编解码器导出的声学 token 的掩码语言建模目标,来提升语音质量。在最后阶段,一个融合网络将前两个阶段的输出与原始含噪信号进行整合,在信号保真度和感知质量上实现均衡提升。此外,一种聚合多个时间偏移预测的偏移技巧以及输出混合进一步提升了性能。在具有可变采样率和多种失真类型的挑战性多语言数据集上的实验结果,验证了我们方法的有效性。
引用
@article{arxiv.2506.00809,
title = {FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge},
author = {Nabarun Goswami and Tatsuya Harada},
journal= {arXiv preprint arXiv:2506.00809},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025