中文

基于 RNN Transducer 的普通话语音识别中音素感知的唯一字符编码

计算与语言 2022-08-01 v1 声音 音频与语音处理

摘要

对于普通话端到端(E2E)自动语音识别(ASR)任务,相较于基于字符的建模单元,基于发音的建模单元可提升模型训练中建模单元的共享程度,但会遇到同音字问题。本研究提出使用一种新颖的音素感知唯一字符编码来构建基于 E2E RNN-T 的普通话 ASR 系统。所提编码由发音基音节与字符索引(CI)组合而成。通过引入 CI,RNN-T 模型在利用发音信息提取建模单元的同时可克服同音字问题。借助所提编码,模型输出可通过一一映射转换为最终识别结果。我们在 Aishell 与 MagicData 数据集上开展实验,实验结果表明了所提方法的有效性。

关键词

引用

@article{arxiv.2207.14578,
  title  = {Pronunciation-aware unique character encoding for RNN Transducer-based Mandarin speech recognition},
  author = {Peng Shen and Xugang Lu and Hisashi Kawai},
  journal= {arXiv preprint arXiv:2207.14578},
  year   = {2022}
}