中文

基于语音链重构与自转录的半监督序列到序列ASR一致性训练改进

计算与语言 2022-05-17 v1 机器学习 声音 音频与语音处理

摘要

一致性正则化近期被应用于半监督序列到序列(S2S)自动语音识别(ASR)。该原则鼓励ASR模型对带有不同扰动的同一输入语音输出相似预测。现有半监督S2S ASR范式利用SpecAugment作为数据增强,并需要静态教师模型为无转录语音生成伪文本。然而,该范式未能充分利用一致性正则化。首先,SpecAugment的掩码操作可能破坏语音的语言内容,从而影响伪标签质量。其次,S2S ASR需要输入语音与前缀词元以进行下一步预测。离线教师模型生成的静态前缀词元无法在一致性训练期间与动态伪标签匹配。本工作中,我们提出一种改进的半监督S2S ASR一致性训练范式。我们利用语音链重构作为弱增强以生成高质量伪标签。此外,我们证明由学生ASR模型生成的动态伪转录文本有益于一致性训练。在LJSpeech与LibriSpeech语料库上的实验表明,相较于有监督基线,我们的改进范式在单说话人设定下取得12.2%的CER提升,在多说话人设定下取得38.6%的提升。

关键词

引用

@article{arxiv.2205.06963,
  title  = {Improved Consistency Training for Semi-Supervised Sequence-to-Sequence ASR via Speech Chain Reconstruction and Self-Transcribing},
  author = {Heli Qi and Sashi Novitasari and Sakriani Sakti and Satoshi Nakamura},
  journal= {arXiv preprint arXiv:2205.06963},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022