中文

基于发音驱动子词分词的 CTC 端到端语音识别个性化

机器学习 2023-10-17 v1

摘要

深度学习与自动语音识别的最新进展提升了端到端语音识别系统的准确率,但联系人姓名等个人内容的识别仍具挑战。本工作中,我们描述了基于连接主义时序分类的端到端语音识别系统的个性化方案。在先前工作基础上,我们提出一种从个人实体的发音生成额外子词分词的新型方法。我们表明,将该技术与上下文偏置和 wordpiece 先验归一化两种既有技术结合使用,能够实现与具竞争力的混合系统相当的个人命名实体准确率。

关键词

引用

@article{arxiv.2310.09988,
  title  = {Personalization of CTC-based End-to-End Speech Recognition Using Pronunciation-Driven Subword Tokenization},
  author = {Zhihong Lei and Ernest Pusateri and Shiyi Han and Leo Liu and Mingbin Xu and Tim Ng and Ruchir Travadi and Youyuan Zhang and Mirko Hannemann and Man-Hung Siu and Zhen Huang},
  journal= {arXiv preprint arXiv:2310.09988},
  year   = {2023}
}