中文

低资源语言的语法纠错:扎尔加的案例研究

计算与语言 2026-02-05 v3 机器学习

摘要

语法纠错 (GEC) 旨在提高文本质量和可读性。先前工作主要聚焦于高资源语言,而低资源语言缺乏稳健工具。为此,我们present了针对 GEC for Zarma 的研究,Zarma 是西非超过五百万人的语言。我们比较了三种方法:基于规则的方法、机器翻译 (MT) 模型和大语言模型 (LLM)。我们使用超过 25 万个例子的数据集评估 GEC 模型,包括合成数据和人工标注数据。我们的结果表明,基于 MT 的方法使用 M2M100 在自动评估 (AE) 中的检测率为 95.82%,建议准确率为 78.90%,在 native speaker 的手动评估 (ME) 中平均得分为 5.0中的 3.0,用于 grammar 和 logical 的纠正。基于规则的方法对拼写错误有效,但在复杂的 context-level 错误上失败。LLM -- Gemma 2b 和 MT5-small -- 显示中等性能。我们的工作支持在低资源环境中使用 MT 模型来增强 GEC,并通过巴巴拉验证了这些结果,巴巴拉是另一西非语言。

关键词

引用

@article{arxiv.2410.15539,
  title  = {Grammatical Error Correction for Low-Resource Languages: The Case of Zarma},
  author = {Mamadou K. Keita and Adwoa Bremang and Huy Le and Dennis Owusu and Christopher Homan and Marcos Zampieri},
  journal= {arXiv preprint arXiv:2410.15539},
  year   = {2026}
}