端到端自动语音识别中基于同音字的标签平滑
音频与语音处理
2020-05-15 v2 计算与语言
声音
摘要
本文提出一种利用人类层面语言先验知识——同音字——的新的标签平滑方法,用于自动语音识别(ASR)。与其前身方法相比,所提方法以更复杂的方式利用同音字的发音知识。端到端 ASR 模型联合学习声学模型与语言模型、且以字符为建模单元,是该方法成立的必要条件。基于混合 CTC 序列到序列模型的实验表明,新方法可将字符错误率(CER)绝对降低 0.4%。
引用
@article{arxiv.2004.03437,
title = {Homophone-based Label Smoothing in End-to-End Automatic Speech Recognition},
author = {Yi Zheng and Xianjie Yang and Xuyong Dang},
journal= {arXiv preprint arXiv:2004.03437},
year = {2020}
}