中文

Thutmose Tagger:用于逆文本规范化的单遍神经模型

计算与语言 2022-08-02 v1 人工智能

摘要

逆文本规范化(ITN)是自动语音识别(ASR)中必不可少的后处理步骤。它将 ASR 生成的口语形式中的数字、日期、缩写及其他符号类转换为其书写形式。可将 ITN 视为机器翻译任务并使用神经序列到序列模型来解决。遗憾的是,此类神经模型容易出现幻觉,可能导致不可接受的错误。为缓解该问题,我们提出了一种单遍词元分类器模型,将 ITN 视为标注任务。该模型为每个输入词元分配一个替换片段,或将其标记为删除或原样复制。我们提出了一种基于 ITN 样例粒度对齐的数据集准备方法。所提模型较少出现幻觉错误。该模型在 Google Text Normalization 数据集上训练,并在英语和俄语测试集上取得了最先进的句子准确率。标签与输入词之间的一一对应关系提升了模型预测的可解释性,简化了调试,并允许进行后处理修正。该模型比序列到序列模型更简单,且更易于在生产环境中优化。该模型及用于准备数据集的代码已作为 NeMo 项目的一部分发布。

关键词

引用

@article{arxiv.2208.00064,
  title  = {Thutmose Tagger: Single-pass neural model for Inverse Text Normalization},
  author = {Alexandra Antonova and Evelina Bakhturina and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2208.00064},
  year   = {2022}
}