拼音-汉字双解码在端到端普通话中文 ASR 中的有效性研究
计算与语言
2022-03-31 v2 声音
音频与语音处理
摘要
端到端自动语音识别(ASR)已取得令人瞩目的成果。然而,大多数现有端到端 ASR 方法忽视了特定语言特性的利用。对于普通话中文 ASR 任务,拼音与汉字之间存在相互促进关系,汉字可由拼音罗马化。基于上述直觉,我们首先在单输入双输出(SIDO)多任务框架下考察了各类基于端到端编码器-解码器的模型,随后根据拼音与汉字间的一一对应特性,提出了一种带模糊拼音采样的异步解码方法。此外,我们提出了一种两阶段训练策略,以使训练更稳定且收敛更快。在 AISHELL-1 数据集测试集上的结果表明,所提出的增强双解码器模型在无语言模型的情况下相较强基线模型有大幅改进。
引用
@article{arxiv.2201.10792,
title = {On the Effectiveness of Pinyin-Character Dual-Decoding for End-to-End Mandarin Chinese ASR},
author = {Zhao Yang and Dianwen Ng and Xiao Fu and Liping Han and Wei Xi and Rui Wang and Rui Jiang and Jizhong Zhao},
journal= {arXiv preprint arXiv:2201.10792},
year = {2022}
}
备注
submitted to INTERSPEECH 2022