中文

面向通用语音增强的混合判别式与生成式系统

声音 2026-01-28 v1 音频与语音处理

摘要

通用语音增强旨在处理各种语音失真和录音条件。在本工作中,我们提出了一种新型混合体系结构,融合判别式建模的信噪比和生成式建模的重构能力。该系统利用带有采样频率独立策略的判别式 TF-GridNet 模型来处理可变采样率;并行地,结合谱映射建模的自回归模型生成细节丰富的语音,有效抑制生成式噪声。最后,融合网络在信噪比损失和综合语音质量评估(SQA)损失的优化下学习两者输出的自适应权重。我们提出的系统在 ICASSP 2026 URGENT 挑战(Track 1)中进行评估,排名第三。

关键词

引用

@article{arxiv.2601.19113,
  title  = {A Hybrid Discriminative and Generative System for Universal Speech Enhancement},
  author = {Yinghao Liu and Chengwei Liu and Xiaotao Liang and Haoyin Yan and Shaofei Xue and Zheng Xue},
  journal= {arXiv preprint arXiv:2601.19113},
  year   = {2026}
}

备注

Accepted by ICASSP 2026.This work was submitted to the ICASSP 2026 URGENT Challenge (Track 1)