中文

端到端自动语音识别中基于同音字的标签平滑

音频与语音处理 2020-05-15 v2 计算与语言 声音

摘要

本文提出一种利用人类层面语言先验知识——同音字——的新的标签平滑方法,用于自动语音识别(ASR)。与其前身方法相比,所提方法以更复杂的方式利用同音字的发音知识。端到端 ASR 模型联合学习声学模型与语言模型、且以字符为建模单元,是该方法成立的必要条件。基于混合 CTC 序列到序列模型的实验表明,新方法可将字符错误率(CER)绝对降低 0.4%。

关键词

引用

@article{arxiv.2004.03437,
  title  = {Homophone-based Label Smoothing in End-to-End Automatic Speech Recognition},
  author = {Yi Zheng and Xianjie Yang and Xuyong Dang},
  journal= {arXiv preprint arXiv:2004.03437},
  year   = {2020}
}