基于 RNN Transducer 的普通话语音识别中音素感知的唯一字符编码
计算与语言
2022-08-01 v1 声音
音频与语音处理
摘要
对于普通话端到端(E2E)自动语音识别(ASR)任务,相较于基于字符的建模单元,基于发音的建模单元可提升模型训练中建模单元的共享程度,但会遇到同音字问题。本研究提出使用一种新颖的音素感知唯一字符编码来构建基于 E2E RNN-T 的普通话 ASR 系统。所提编码由发音基音节与字符索引(CI)组合而成。通过引入 CI,RNN-T 模型在利用发音信息提取建模单元的同时可克服同音字问题。借助所提编码,模型输出可通过一一映射转换为最终识别结果。我们在 Aishell 与 MagicData 数据集上开展实验,实验结果表明了所提方法的有效性。
引用
@article{arxiv.2207.14578,
title = {Pronunciation-aware unique character encoding for RNN Transducer-based Mandarin speech recognition},
author = {Peng Shen and Xugang Lu and Hisashi Kawai},
journal= {arXiv preprint arXiv:2207.14578},
year = {2022}
}