中文

利用 LLMs 进行孟加拉语语法错误纠正:错误分类、合成数据与模型评估

计算与语言 2025-06-06 v2 人工智能

摘要

大型语言模型(LLMs)在包括英语在内的许多语言的自然语言理解(NLU)任务中表现卓越。然而,尽管孟加拉语是全球第五大语言,语法错误纠正(GEC)领域仍未得到发展。本文调查了如何利用 LLMs 提升孟加拉语 GEC 的性能。首先,对 12 类错误进行了广泛分类,并对孟加拉语母语者进行调查收集真实世界的错误。随后,我们设计一种基于规则的噪声注入方法,以正确句子为基础创建语法错误的句子。所创建的 Vaiyakarana 数据集包含 567,422 句,其中 227,119 句带有错误。随后使用该数据集对 LLMs 进行 GEC 任务的指令微调。评估显示,指令微调 \name 可使 LLMs 在 GEC 性能上提升 3-7 个百分点,优于零-shot 设置,使其在语法错误识别方面达到人类水平。然而,人类在错误纠正方面仍占上风。

关键词

引用

@article{arxiv.2406.14284,
  title  = {Leveraging LLMs for Bangla Grammar Error Correction:Error Categorization, Synthetic Data, and Model Evaluation},
  author = {Pramit Bhattacharyya and Arnab Bhattacharya},
  journal= {arXiv preprint arXiv:2406.14284},
  year   = {2025}
}

备注

Accepted at ACL Findings, 2025