用于提升ASR准确率的发音变体生成与剪枝
计算与语言
2016-06-29 v1
摘要
语音识别,尤其是名称识别,广泛应用于电话服务中,如公司目录拨号器、股票报价提供商或位置查找器。由于发音变化,它通常具有挑战性。本文提出一种高效且鲁棒的数据驱动技术,其自动学习可接受的词发音并更新发音词典,以构建更好的词典,且不影响与目标词相似的其他词的识别。它在不同大小的数据集上泛化良好,并且在一个包含13000+人名的数据库上,与已覆盖名字中97%+词规范发音的正则词典外加训练良好的拼写到发音(spelling-to-pronunciation, STP)引擎的基线相比,将错误率降低了42%。
引用
@article{arxiv.1606.08821,
title = {Generation and Pruning of Pronunciation Variants to Improve ASR Accuracy},
author = {Zhenhao Ge and Aravind Ganapathiraju and Ananth N. Iyer and Scott A. Randal and Felix I. Wyss},
journal= {arXiv preprint arXiv:1606.08821},
year = {2016}
}
备注
Interspeech 2016