FastInject:将未配对文本数据注入基于CTC的ASR训练
音频与语音处理
2023-12-15 v1 声音
摘要
最近,基于连接时序分类(CTC)的端到端自动语音识别(ASR)模型取得了令人瞩目的成果,尤其是在自监督学习发展的推动下。然而,在配对语音-文本数据上训练的端到端ASR模型常常面临从训练到测试的领域偏移问题。为了缓解这一问题,本文提出了一种名为FastInject的平坦启动联合训练方法,该方法高效地将多领域未配对文本数据注入基于CTC的ASR训练中。为了保持训练效率,文本单元被预先上采样,其表示与语音特征一起输入CTC模型。为了弥合语音和文本之间的模态差距,提出了一种基于注意力的模态匹配机制(AM3),该机制保留了端到端的平坦启动训练。实验表明,所提出的FastInject在领域内Librispeech-100h数据上实现了22%的相对词错误率降低(WERR),在领域外测试集上实现了20%的相对WERR。
引用
@article{arxiv.2312.09100,
title = {FastInject: Injecting Unpaired Text Data into CTC-based ASR training},
author = {Keqi Deng and Philip C. Woodland},
journal= {arXiv preprint arXiv:2312.09100},
year = {2023}
}
备注
Accepted by ICASSP2024