面向CTC语音识别模型个性化的上下文适配器与自适应增强方法
计算与语言
2022-11-15 v3 声音
音频与语音处理
摘要
近期,使用联合连接主义时序分类(CTC)-注意力损失训练的端到端语音识别模型日益流行。在这些模型中,非自回归的CTC解码器常因其速度与简洁性而在推理时被采用。然而,此类模型难以个性化,因为其条件独立假设阻止了先前时间步的输出词元影响未来预测。为此,我们提出一种新颖的双向方法:首先利用对预定义的罕见长尾词和词汇表外(OOV)词列表的注意力来偏置编码器,然后在解码过程中使用动态增强与音素对齐网络进一步偏置子词预测。我们在开源VoxPopuli和内部医疗数据集上评估了该方法,相比强CTC基线在特定领域罕见词上F1分数提升达60%。
引用
@article{arxiv.2210.09510,
title = {Towards Personalization of CTC Speech Recognition Models with Contextual Adapters and Adaptive Boosting},
author = {Saket Dingliwal and Monica Sunkara and Sravan Bodapati and Srikanth Ronanki and Jeff Farris and Katrin Kirchhoff},
journal= {arXiv preprint arXiv:2210.09510},
year = {2022}
}
备注
To appear in SLT 2022