面向通用语音增强的混合判别式与生成式系统
声音
2026-01-28 v1 音频与语音处理
摘要
通用语音增强旨在处理各种语音失真和录音条件。在本工作中,我们提出了一种新型混合体系结构,融合判别式建模的信噪比和生成式建模的重构能力。该系统利用带有采样频率独立策略的判别式 TF-GridNet 模型来处理可变采样率;并行地,结合谱映射建模的自回归模型生成细节丰富的语音,有效抑制生成式噪声。最后,融合网络在信噪比损失和综合语音质量评估(SQA)损失的优化下学习两者输出的自适应权重。我们提出的系统在 ICASSP 2026 URGENT 挑战(Track 1)中进行评估,排名第三。
引用
@article{arxiv.2601.19113,
title = {A Hybrid Discriminative and Generative System for Universal Speech Enhancement},
author = {Yinghao Liu and Chengwei Liu and Xiaotao Liang and Haoyin Yan and Shaofei Xue and Zheng Xue},
journal= {arXiv preprint arXiv:2601.19113},
year = {2026}
}
备注
Accepted by ICASSP 2026.This work was submitted to the ICASSP 2026 URGENT Challenge (Track 1)