PROCTER:用于神经转导器中个性化语音识别的发音感知上下文适配器
音频与语音处理
2024-02-09 v1 声音
摘要
语音助手中所用的端到端(E2E)自动语音识别(ASR)系统常难以识别对用户个性化的低频词,如人名与地名。生僻词往往具有非平凡的发音,在此类情况下,以发音词典形式呈现的人类知识会很有用。我们提出一种发音感知上下文适配器(PROCTER),其通过添加音素嵌入与文本嵌入,将词典知识动态注入 RNN-T 模型。实验结果表明,所提出的 PROCTER 架构优于基线 RNN-T 模型,在个性化实体与个性化生僻实体上分别将词错误率(WER)降低了 44% 与 57%,而模型规模(可训练参数数量)仅增加 1%。此外,在零样本设定下评估对个性化设备名的识别时,我们观察到 PROCTER 带来 7% 的 WER 提升,而仅含文本的上下文注意力仅带来 1% 的 WER 提升。
引用
@article{arxiv.2303.17131,
title = {PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers},
author = {Rahul Pandey and Roger Ren and Qi Luo and Jing Liu and Ariya Rastrow and Ankur Gandhe and Denis Filimonov and Grant Strimel and Andreas Stolcke and Ivan Bulyko},
journal= {arXiv preprint arXiv:2303.17131},
year = {2024}
}
备注
To appear in Proc. IEEE ICASSP