中文

最小监督的书面至口语文本归一化

计算与语言 2016-09-22 v1

摘要

在诸如文本转语音 (TTS) 或自动语音识别 (ASR) 等语音应用中,\emph{文本归一化} 是指将 \emph{书面} 表示转换为该文本 \emph{口语} 表示的任务。在所有现实世界的语音应用中,文本归一化引擎在很大程度上是手工开发的。例如,可以使用手工构建的语法来枚举在给定语言中说出给定词元的可能方式,并使用统计模型来选择在上下文中最为合适的发音。在本研究中,我们考察了在文本归一化引擎中使用或多或少特定于语言的领域知识所带来的权衡。在数据最丰富的场景下,我们能够使用一个精心构建的手工归一化语法,它可以为任何给定的词元生成该词元所有可能的读音集合。我们还假设存在一个对齐的书面-口语话语语料库,从中我们可以训练一个排序模型,以在给定上下文中选择合适的读音。作为精心构建的语法的替代方案,我们还考虑了具有通用语言归一化 \emph{覆盖语法} 的场景,其中开发者仅需提供该语言特有的一组词汇项。作为对齐语料库的替代方案,我们还考虑了这样一种场景:仅有口语端,而相应的书面端是通过将口语端与倒置的归一化语法组合来“幻觉”生成的。我们研究了在每种场景下文本归一化引擎的准确性。我们报告了在英语和俄语上的实验结果。

关键词

引用

@article{arxiv.1609.06649,
  title  = {Minimally Supervised Written-to-Spoken Text Normalization},
  author = {Ke Wu and Kyle Gorman and Richard Sproat},
  journal= {arXiv preprint arXiv:1609.06649},
  year   = {2016}
}