四合一:面向自动语音识别的逆文本正则化、标点、大写与不流利联合处理方法
计算与语言
2022-10-28 v1
摘要
标点、大写和实体格式化等特征对于可读性、理解和自然语言处理任务至关重要。然而,自动语音识别(ASR)系统产生的是缺乏格式的口语形式文本,而用于格式化的标注方法每次仅处理一两个特征。在本文中,我们通过一个两阶段过程统一了口语到书面文本的转换:首先,我们使用单个 Transformer 标注模型,联合生成用于逆文本正则化(ITN)、标点、大写和不流利的词元级标签。然后,我们应用这些标签生成书面形式的文本,并使用加权有限状态转换器(WFST)语法来格式化已标注的 ITN 实体跨度。尽管将四个模型合并为一个,我们的统一标注方法在多个领域的基准测试集上,在所有四项任务中均达到或超越了特定任务模型的性能。
引用
@article{arxiv.2210.15063,
title = {Four-in-One: A Joint Approach to Inverse Text Normalization, Punctuation, Capitalization, and Disfluency for Automatic Speech Recognition},
author = {Sharman Tan and Piyush Behre and Nick Kibre and Issac Alphonso and Shuangyu Chang},
journal= {arXiv preprint arXiv:2210.15063},
year = {2022}
}