中文

介绍 OmniGEC:用于语法纠错的银质多语言数据集

计算与语言 2025-09-19 v1 人工智能 机器学习

摘要

本文介绍了 OmniGEC,这是一个用于语法纠错任务的多语言银质数据集,覆盖十一个语言:捷克语、英语、爱沙尼亚语、德语、希腊语、冰岛语、意大利语、拉脱维亚语、斯洛文尼亚语、瑞典语和乌克兰语。这些数据集促进了多语言语法纠错解决方案的开发,帮助弥合将英语语法纠错解决方案适配到多语言语法纠错之间的数据差距。数据集中的文本来源于三个来源:来自十一个目标语言的维基百科编辑、来自 Reddit 子版块的十一个目标语言内容,以及乌克兰语专属的 UberText 2.0 社交媒体语料库。虽然维基百科编辑来源于人工制作的纠正,但 Reddit 和 UberText 2.0 数据是使用 GPT-4o-mini 模型自动纠正的。对数据集中纠正质量进行了自动和手动评估。最后,我们在多语言 OmniGEC 语料上微调了两个开源大型语言模型——Aya-Expanse(8B)和 Gemma-3(12B),并在段落级别多语言语法纠错中取得了最新进展(SOTA)结果。数据集收集和最佳模型均已在 Hugging Face 上提供。

关键词

引用

@article{arxiv.2509.14504,
  title  = {Introducing OmniGEC: A Silver Multilingual Dataset for Grammatical Error Correction},
  author = {Roman Kovalchuk and Mariana Romanyshyn and Petro Ivaniuk},
  journal= {arXiv preprint arXiv:2509.14504},
  year   = {2025}
}