面向改进端到端口语语法纠错的缩放与提示
计算与语言
2025-05-28 v1 声音
音频与语音处理
摘要
口语语法纠错(SGEC)与反馈(SGECF)对第二语言学习者、教师和考生至关重要。传统的 SGEC 系统依赖于由 ASR、不流利检测(DD)与去除模块以及 GEC 模块组成的级联流水线。随着端到端(E2E)语音基础模型的兴起,我们研究了它们在 SGEC 和反馈生成中的有效性。本工作引入了伪标注过程以应对标注数据有限的挑战,将训练数据规模从 77 小时扩展到约 2500 小时,从而提升了性能。此外,我们用流畅的转录文本提示基于 Whisper 的 E2E SGEC 模型,结果显示 SGEC 性能有轻微提升,而在反馈生成方面提升更显著。最后,我们评估了增加模型规模的影响,表明虽然伪标注数据未能为更大的 Whisper 模型带来性能提升,但使用提示进行训练被证明是有益的。
引用
@article{arxiv.2505.21137,
title = {Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction},
author = {Mengjie Qian and Rao Ma and Stefano Bannò and Kate M. Knill and Mark J. F. Gales},
journal= {arXiv preprint arXiv:2505.21137},
year = {2025}
}
备注
submitted to Interspeech