中文

Wav2code:通过码本查找恢复干净语音表征以实现噪声鲁棒 ASR

音频与语音处理 2024-04-19 v3 机器学习 声音

摘要

得益于深度学习的近期进展,自动语音识别(ASR)取得了显著成功,但在真实世界噪声条件下通常性能大幅下降。近期工作引入语音增强(SE)作为前端以改善语音质量,这被证明有效,但由于语音失真问题,对下游 ASR 未必最优。基于此,最新工作将 SE 与当前流行的自监督学习(SSL)相结合,以缓解失真并提升噪声鲁棒性。尽管有效,传统 SE 引起的语音失真仍无法彻底消除。本文提出一种名为 Wav2code 的自监督框架,以实现特征级 SE 并减少失真,从而支持噪声鲁棒 ASR。首先,在预训练阶段,将 SSL 模型的干净语音表征通过最近邻特征匹配查找离散码本,所得码序列随后用于重建原始干净表征,以将其作为先验存入码本。其次,在微调阶段,我们提出基于 Transformer 的码预测器,通过对输入噪声表征的全局依赖建模来准确预测干净码,从而实现高质量干净表征的发现与重建并减少失真。此外,我们提出一种交互式特征融合网络,将原始噪声表征与重建的干净表征相结合,兼顾保真度与质量,为下游 ASR 提供信息更丰富的特征。最后,在合成与真实噪声数据集上的实验表明,Wav2code 能解决语音失真问题并在各种噪声条件下提升 ASR 性能,从而获得更强的鲁棒性。

关键词

引用

@article{arxiv.2304.04974,
  title  = {Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR},
  author = {Yuchen Hu and Chen Chen and Qiushi Zhu and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2304.04974},
  year   = {2024}
}

备注

12 pages, 7 figures, IEEE/ACM Transactions on Audio, Speech, and Language Processing