利用细粒度上下文知识选择改进端到端上下文语音识别
计算与语言
2022-03-03 v2 人工智能
声音
音频与语音处理
摘要
当前,端到端上下文语音识别中的多数方法使识别过程偏向上下文知识。由于全神经上下文偏置方法依赖短语级上下文建模与基于注意力的相关性建模,它们可能在相似上下文特定短语间产生混淆,损害 token 级预测。本工作中,我们聚焦于通过细粒度上下文知识选择(FineCoS)缓解混淆问题。在 FineCoS 中,我们引入细粒度知识以降低 token 预测的不确定性。具体而言,我们先应用短语选择缩小候选短语范围,再对选中候选短语中的 token 进行 token 注意力。此外,我们在推理中对最相关短语的注意力权重重新归一化,以获得更聚焦的短语级上下文表示,并注入位置信息以更好区分短语或 token。在 LibriSpeech 与一内部 160,000 小时数据集上,我们基于可控全神经偏置方法协同解码(ColDec)探索所提方法。相较 ColDec,所提方法在 LibriSpeech 上最多提供 6.1% 相对词错误率下降,在内部数据集上提供 16.4% 相对字符错误率下降。
引用
@article{arxiv.2201.12806,
title = {Improving End-to-End Contextual Speech Recognition with Fine-Grained Contextual Knowledge Selection},
author = {Minglun Han and Linhao Dong and Zhenlin Liang and Meng Cai and Shiyu Zhou and Zejun Ma and Bo Xu},
journal= {arXiv preprint arXiv:2201.12806},
year = {2022}
}
备注
Accepted by ICASSP 2022