中文

罗马尼亚语神经语法纠错

计算与语言 2026-04-28 v1 机器学习

摘要

非英语语言的语法纠错(GEC)资源稀缺,而现有拼写检查器大多仅限于简单纠正和规则。在本文中,我们引入了由 1 万对句子组成的罗马尼亚语第一批 GEC 语料库。此外,针对罗马尼亚语改编了德文版 ERROR ANnotation Toolkit(ERRANT)评分器,以分析该语料库并提取用于评估的编辑。实验了多种神经模型,以及在低资源环境下有效的预训练策略。我们的基线模型仅在 GEC 数据集上训练的小型 Transformer(F0.5 为 44.38),而表现最佳的模型则通过在人工生成数据上预训练较大的 Transformer 再在实际语料库上微调得到(F0.5 为 53.76)。该方法用于生成额外训练样本的方案易于扩展,可应用于任何语言,仅需词性标注器。

关键词

引用

@article{arxiv.2604.23627,
  title  = {Neural Grammatical Error Correction for Romanian},
  author = {Teodor-Mihai Cotet and Stefan Ruseti and Mihai Dascalu},
  journal= {arXiv preprint arXiv:2604.23627},
  year   = {2026}
}