中文

面向跨域语音识别与增强的通用鲁棒语音适应

音频与语音处理 2026-03-03 v2 计算与语言 机器学习 声音

摘要

预训练的自动语音识别(ASR)和语音增强(SE)模型在匹配噪声和信道条件下表现出惊人的能力,但在面对 domain 偏移,尤其是不可见噪声和信道失真时,常出现显著的性能下降。为此,我们本文提出 URSA-GAN,一个统一且 domain-aware 的生成框架,专为缓解噪声和信道条件之间的不匹配而设计。URSA-GAN 利用由噪声编码器和信道编码器组成的双嵌入架构,每个编码器都使用有限的 in-domain 数据进行预训练,以捕获与 domain 相关的表示。这些嵌入条件化一个基于 GAN 的语音生成器,促进语音在目标 domain 声学上与之对齐,同时保持语音内容。为进一步提升泛化能力,我们提出了动态随机扰动,这是一种新的正则化技术,通过在生成过程中引入对嵌入的受控变异性来促进对不可见 domain 的鲁棒性。经验结果表明,URSA-GAN 在多种噪声和不匹配信道情形下有效降低了 ASR 的字符错误率,并改善了 SE 的感知指标。值得注意的是,在包含信道和噪声双重失真的复合 test 条件下的评估确认了 URSA-GAN 的泛化能力,ASR 性能提升 16.16%,SE 指标提升 15.58%。

关键词

引用

@article{arxiv.2602.04307,
  title  = {Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement},
  author = {Chien-Chun Wang and Hung-Shin Lee and Hsin-Min Wang and Berlin Chen},
  journal= {arXiv preprint arXiv:2602.04307},
  year   = {2026}
}

备注

Accepted to IEEE Transactions on Audio, Speech and Language Processing (IEEE TASLP)