中文

大语言模型应理解拼音以提高中文ASR错误纠正

计算与语言 2024-09-23 v1 声音 音频与语音处理

摘要

大型语言模型可通过生成式纠错来提升自动语音识别系统的性能。本文提出Pinyin-enhanced GEC(PY-GEC),利用拼音(Pinyin)——普通话的音标表示——作为补充信息来改进中文ASR错误纠正。我们的做法仅使用人工生成的错误进行训练,并在推理阶段采用一最佳假设。此外,我们引入一种涉及拼音与文本之间转换任务的多任务训练方法,以对齐其特征空间。在Aishell-1和Common Voice数据集上的实验表明,我们的方法在文本输入-only的GEC基础上 consistently 优于。更重要的是,我们从两个方面直观地解释了PY-GEC和多任务训练的有效性:1)增加对拼音特征的注意力权重;2)拼音和文本隐藏状态之间的特征空间对齐。

关键词

引用

@article{arxiv.2409.13262,
  title  = {Large Language Model Should Understand Pinyin for Chinese ASR Error Correction},
  author = {Yuang Li and Xiaosong Qiao and Xiaofeng Zhao and Huan Zhao and Wei Tang and Min Zhang and Hao Yang},
  journal= {arXiv preprint arXiv:2409.13262},
  year   = {2024}
}