通过数据增强、半监督学习与后对齐方法提升神经逆文本规范化的鲁棒性
计算与语言
2023-09-19 v1
摘要
逆文本规范化(ITN)对于将口语形式转换为书写形式至关重要,尤其在自动语音识别(ASR)语境下。尽管大多数ASR下游任务依赖书写形式,ASR系统常输出口语形式,这凸显了在产品级基于ASR的应用中具备鲁棒ITN的必要性。虽然神经ITN方法已显现前景,仍面临性能挑战,尤其在处理ASR生成的口语文本时。这些挑战源于训练数据与ASR生成文本之间的域外问题。为此,我们提出一种直接训练方法,利用ASR生成的书写或口语文本,分别通过ASR语言上下文仿真增强配对,以及由大语言模型增强的半监督学习方法。此外,我们引入后对齐方法以管控不可预测错误,从而提升ITN的可靠性。实验表明,所提方法显著改善了多种ASR场景下的ITN性能。
引用
@article{arxiv.2309.08626,
title = {Improving Robustness of Neural Inverse Text Normalization via Data-Augmentation, Semi-Supervised Learning, and Post-Aligning Method},
author = {Juntae Kim and Minkyu Lim and Seokjin Hong},
journal= {arXiv preprint arXiv:2309.08626},
year = {2023}
}
备注
submitted to ICASSP 2024