中文

探索无词典建模单元用于端到端韩语及韩英码切换语音识别

声音 2019-10-28 v1 音频与语音处理

摘要

随着基于字符的端到端自动语音识别(ASR)模型的发展,声学建模单元的选择变得重要。由于韩语是一种相当表音的语言,并拥有带其特有韩文字母的独特书写系统,值得为端到端韩语 ASR 任务研究建模单元。在本工作中,我们引入韩语中的无词典建模单元,并使用混合 CTC/基于注意力编码器-解码器模型对其进行探索。研究了五种无词典单元:基于音节的韩文字符(码切换任务中使用英文字符)、韩文 Jamo 字符(使用英文字符)、基于音节字符的子词(英语中使用子词)、基于 Jamo 字符的子词(英语中使用子词),以及最后的字节单元(跨语言的通用单元)。分别在 Zeroth-Korean(51.6 小时)和 Medical Record(2530 小时)上进行了韩语及韩英码切换 ASR 任务的实验。基于韩语音节(及英语子词)的子词序列到序列学习在两项任务中均表现最佳,且无需词典和额外的语言模型集成。

关键词

引用

@article{arxiv.1910.11590,
  title  = {Exploring Lexicon-Free Modeling Units for End-to-End Korean and Korean-English Code-Switching Speech Recognition},
  author = {Jisung Wang and Jihwan Kim and Sangki Kim and Yeha Lee},
  journal= {arXiv preprint arXiv:1910.11590},
  year   = {2019}
}

备注

5 pages, 3 figures