中文

FastInject:将未配对文本数据注入基于CTC的ASR训练

音频与语音处理 2023-12-15 v1 声音

摘要

最近,基于连接时序分类(CTC)的端到端自动语音识别(ASR)模型取得了令人瞩目的成果,尤其是在自监督学习发展的推动下。然而,在配对语音-文本数据上训练的端到端ASR模型常常面临从训练到测试的领域偏移问题。为了缓解这一问题,本文提出了一种名为FastInject的平坦启动联合训练方法,该方法高效地将多领域未配对文本数据注入基于CTC的ASR训练中。为了保持训练效率,文本单元被预先上采样,其表示与语音特征一起输入CTC模型。为了弥合语音和文本之间的模态差距,提出了一种基于注意力的模态匹配机制(AM3),该机制保留了端到端的平坦启动训练。实验表明,所提出的FastInject在领域内Librispeech-100h数据上实现了22%的相对词错误率降低(WERR),在领域外测试集上实现了20%的相对WERR。

关键词

引用

@article{arxiv.2312.09100,
  title  = {FastInject: Injecting Unpaired Text Data into CTC-based ASR training},
  author = {Keqi Deng and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2312.09100},
  year   = {2023}
}

备注

Accepted by ICASSP2024