罗马尼亚语神经语法纠错
计算与语言
2026-04-28 v1 机器学习
摘要
非英语语言的语法纠错(GEC)资源稀缺,而现有拼写检查器大多仅限于简单纠正和规则。在本文中,我们引入了由 1 万对句子组成的罗马尼亚语第一批 GEC 语料库。此外,针对罗马尼亚语改编了德文版 ERROR ANnotation Toolkit(ERRANT)评分器,以分析该语料库并提取用于评估的编辑。实验了多种神经模型,以及在低资源环境下有效的预训练策略。我们的基线模型仅在 GEC 数据集上训练的小型 Transformer(F0.5 为 44.38),而表现最佳的模型则通过在人工生成数据上预训练较大的 Transformer 再在实际语料库上微调得到(F0.5 为 53.76)。该方法用于生成额外训练样本的方案易于扩展,可应用于任何语言,仅需词性标注器。
关键词
引用
@article{arxiv.2604.23627,
title = {Neural Grammatical Error Correction for Romanian},
author = {Teodor-Mihai Cotet and Stefan Ruseti and Mihai Dascalu},
journal= {arXiv preprint arXiv:2604.23627},
year = {2026}
}