中文

InterAug:利用带噪中间预测增强基于 CTC 的 ASR

计算与语言 2022-04-04 v1 声音 音频与语音处理

摘要

本文提出 InterAug:一种利用增强的中间表征进行条件化的、针对基于 CTC 的 ASR 的新训练方法。所提方法借助自条件化 CTC 的条件化框架,通过以“带噪”的中间预测进行条件化来训练鲁棒模型。在训练过程中,中间预测被改为错误的中间预测,并送入下一层用于条件化。后续层以中间损失被训练来纠正这些错误的中间预测。通过重复增强与纠正,通常需特殊解码器的迭代细化可仅用音频编码器实现。为产生带噪中间预测,我们还引入新的增强方式:旨在模拟典型错误的中间特征空间增强与中间词符空间增强。所提 InterAug 框架与新增强方式的结合使得对鲁棒音频编码器的显式训练成为可能。在使用模拟删除、插入和替换错误的增强实验中,我们确认训练后的模型获得了对各类错误的鲁棒性,提升了强自条件化 CTC 基线的语音识别性能。

关键词

引用

@article{arxiv.2204.00174,
  title  = {InterAug: Augmenting Noisy Intermediate Predictions for CTC-based ASR},
  author = {Yu Nakagome and Tatsuya Komatsu and Yusuke Fujita and Shuta Ichimura and Yusuke Kida},
  journal= {arXiv preprint arXiv:2204.00174},
  year   = {2022}
}

备注

This paper was submitted to INTERSPEECH2022