中文

用于文本规范化的加权有限状态转录机与语言模型的浅融合

计算与语言 2022-03-31 v1

摘要

生产环境中的文本规范化(TN)系统主要基于规则并使用加权有限状态转录机(WFST)。然而,当规范化形式依赖上下文时,基于 WFST 的系统难以处理歧义输入。另一方面,神经文本规范化系统可考虑上下文,但存在不可恢复错误且需要难以收集的标注规范化数据集。我们提出一种结合规则系统与神经系统优势的混合新方法。首先,非确定性 WFST 输出所有规范化候选,然后神经语言模型选取最佳者——类似于自动语音识别中的浅融合。WFST 防止不可恢复错误,而语言模型解决上下文歧义。该方法易于扩展,且我们证明其有效,取得了与现有最先进 TN 模型相当或更好的结果。

关键词

引用

@article{arxiv.2203.15917,
  title  = {Shallow Fusion of Weighted Finite-State Transducer and Language Model for Text Normalization},
  author = {Evelina Bakhturina and Yang Zhang and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2203.15917},
  year   = {2022}
}