向前迈进:通过合成数据和检索增强提升ASR的生成式错误纠正
数学物理
2024-11-19 v2 math.MP
可精确求解与可积系统
摘要
生成式错误纠正(GEC)已成为增强自动语音识别(ASR)系统性能的强大后处理方法。然而,我们发现GEC模型在训练期间遇到的特定错误类型之外难以泛化,限制了其在测试时纠正新出现的未见错误的能力,尤其是在域外(OOD)场景中。这一现象在命名实体(NEs)方面尤为突出,除了上下文信息不足或对NEs缺乏了解外,新的NEs持续出现。为解决这些问题,我们提出了DARAG(Data- and Retrieval-Augmented Generative Error Correction),一种旨在提升ASR中GEC在域内(ID)和OOD场景下性能的新方法。我们通过调用大语言模型和语音合成模型生成合成数据来增强GEC训练数据集,从而模拟来自不同来源的额外错误,使模型能够学习。对于OOD场景,我们类似地以无监督方式模拟来自新领域的测试时错误。此外,为了更好地处理命名实体,我们引入检索增强纠正,通过从数据库检索实体来增强输入。我们的方法简单、可扩展,同时具备域-agnostic和语言-agnostic特性。在多个数据集和设置上进行实验,表明DARAG在ID和OOD设置下均优于所有基线,分别实现了8%--30%的相对WER提升和10%--33%的提升。
引用
@article{arxiv.2410.13197,
title = {Representation of Linear Waves in Inhomogeneous Media},
author = {O. V. Kaptsov},
journal= {arXiv preprint arXiv:2410.13197},
year = {2024}
}