中文

通过多任务学习实现对抗噪声下的语音逆变

音频与语音处理 2026-01-22 v1 声音

摘要

最近的研究表明,自监督学习(SSL)语音表示对语音逆变(Speech Inversion, SI)具有有效性。然而,由于背景噪声的普遍存在,在实际场景中应用 SI 仍富有挑战性。我们提出了一个统一框架,将语音增强(Speech Enhancement, SE)和 SI 模型整合到共享 SSL 语音表示中。在该框架中,SSL 模型不仅支持 SE 模块抑制噪声,还能产生更适用于 SI 任务的表示,使两个模块都能从联合训练中受益。在信噪比为 -5 dB 的情况下,我们的方法在 babble 噪声下对 SI 任务实现了 80.95% 的相对改进,在非 babble 噪声下实现了 38.98% 的相对改进,作为衡量所有估计参数平均皮尔逊乘积moment相关系数的指标。

关键词

引用

@article{arxiv.2601.14516,
  title  = {Towards noise-robust speech inversion through multi-task learning with speech enhancement},
  author = {Saba Tabatabaee and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2601.14516},
  year   = {2026}
}

备注

Accepted for presentation at ICASSP 2026