中文

一种用于双工文本规范化的统一 Transformer 框架

计算与语言 2021-08-24 v1

摘要

文本规范化(TN)和逆文本规范化(ITN)分别是语音合成和自动语音识别中必不可少的预处理和后处理步骤。已有许多针对 TN 或 ITN 的方法被提出,从加权有限状态转换器到神经网络不等。尽管它们性能出色,这些方法仅旨在解决两项任务之一而非同时解决两者。因此,在完整的口语对话系统中,需要为 TN 和 ITN 分别构建两个模型。这种异构性增加了系统的技术复杂度,进而提高了生产环境中的维护成本。受此启发,我们提出了一个统一框架,用于构建可同时处理 TN 和 ITN 的单一神经双工系统。结合一种简单而有效的数据增强方法,我们的系统在 Google 英文和俄文 TN 数据集上取得了最先进(SOTA)的结果。它们还能在内部英文 TN 数据集上达到超过 95% 的句子级准确率,且无需任何额外微调。此外,我们还从 Spoken Wikipedia Corpora 中创建了一个清洗后的德文数据集,并报告了系统在该数据集上的性能。总体而言,实验结果证明了所提出的双工文本规范化框架高度有效,并可应用于一系列领域和语言。

关键词

引用

@article{arxiv.2108.09889,
  title  = {A Unified Transformer-based Framework for Duplex Text Normalization},
  author = {Tuan Manh Lai and Yang Zhang and Evelina Bakhturina and Boris Ginsburg and Heng Ji},
  journal= {arXiv preprint arXiv:2108.09889},
  year   = {2021}
}

备注

Under Review