中文

数据稀缺时,聪明地使用提示:低资源环境下语法纠错的方法

计算与语言 2025-11-26 v1 人工智能

摘要

语法纠错(GEC)是自然语言处理中的重要任务,旨在自动检测和纠正文本中的语法错误。尽管基于Transformer的模型和大型标注数据集的近期进展大大提升了英语等高资源语言GEC的性能,但这种进展并未在其他语言中均匀扩展。对于大多数印度语言,GEC仍是一个具有挑战性的任务,由于资源有限、语言多样性和复杂形态结构。本文探索了使用最先进的大型语言模型(LLM),如GPT-4.1、Gemini-2.5和LLaMA-4,结合零样本和少样本策略,以提示方式适应低资源环境。我们观察到,即使是最基本的提示策略,如零样本和少样本方法,也能使这些LLM在GEC任务上显著优于微调的印度语言模型,如Sarvam-22B,从而说明了当代LLM在GEC任务中所具有的异常大的多语言泛化能力。我们的实验表明, carefully 设计的提示和轻量级适应显著增强了跨多个印度语言的纠错质量。我们在共享任务中取得了领先成绩——在泰米尔语(GLEU: 91.57)和印地语(GLEU: 85.69)中名列第一,在泰卢固语(GLEU: 85.22)中名列第二,在孟加拉语(GLEU: 92.86)中名列第四,在马拉拉姆语(GLEU: 92.97)中名列第五。这些发现突显了提示驱动的NLP技术的有效性,并凸显了大规模LLM在 bridging 资源差距方面的潜力。

关键词

引用

@article{arxiv.2511.20120,
  title  = {"When Data is Scarce, Prompt Smarter"... Approaches to Grammatical Error Correction in Low-Resource Settings},
  author = {Somsubhra De and Harsh Kumar and Arun Prakash A},
  journal= {arXiv preprint arXiv:2511.20120},
  year   = {2025}
}

备注

10 pages, 5 figures, 5 tables; Accept-demonstration at BHASHA Workshop, IJCNLP-AACL 2025