中文

基于多变量一致性的自监督学习用于鲁棒自动语音识别

声音 2022-05-05 v2 计算与语言 音频与语音处理

摘要

自动语音识别(ASR)近年进展迅速,但在远场与噪声环境中性能仍显著下降。自监督学习(SSL)技术近期的发展可通过用额外无标签语音预训练模型来提升ASR性能,且SSL预训练模型已在若干语音基准上取得最先进结果。然而,以往多数SSL方法忽视了背景噪声或混响的影响,而这对在真实语音应用中部署ASR系统至关重要。本研究通过引入一种适应不同环境的基于多变量一致性(MVC)的SSL方法来解决鲁棒ASR问题。MVC-SSL是一种面向真实应用中含噪与远距离通话语音的鲁棒SSL预训练方法。相较以往SSL方法,MVC-SSL可计算不同声学条件或通道下音频间的对比损失,并能随环境或录音设备变化学习不变表示。我们还探索了不同的SSL训练流程,以平衡含噪远距离通话语音与额外的高资源干净语音。我们在商业导向数据集CHiME-4与会议数据集AMI上评估了所提方法。借助MVC-SSL与恰当训练流程,相较最成功ASR的SSL方法之一的基线wav2vec2.0,我们实现了最高30%的相对词错误率下降。

关键词

引用

@article{arxiv.2112.12522,
  title  = {Multi-Variant Consistency based Self-supervised Learning for Robust Automatic Speech Recognition},
  author = {Changfeng Gao and Gaofeng Cheng and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2112.12522},
  year   = {2022}
}

备注

6 pages, 3 figures