面向低资源印地语言最小编辑指令调优
计算与语言
2025-12-02 v1
摘要
印地语言语法纠错面临监督数据有限、脚本多样、形态复杂等挑战。我们提出无数据增强 setup,采用指令调优大型语言模型和保守解码。使用参数高效微调 (PEFT) 和 Alpaca 风格格式,在 bnb 4-bit 精度下对 12B 参数的 GEMMA 3 模型进行指令调优。解码遵循确定性、受约束的方式,采用轻量级正规化器以鼓励最小且语义保存的编辑。我们通过固定、语言特定的提示实现推理,该提示直接来自在训练语料上计算得到的确定性错误分类器的分类学、标签分布及其优先级排序。根据官方未调优 GLEU 评估,系统在 Malayalam 上得分 92.41(全球第 6),在 Hindi 上得分 81.44(全球第 3)。这些结果表明,分类器驱动的提示设计、基于适配器的指令调优以及确定性解码为印地 GEC 提供了可复现且计算高效的无数据增强管道替代方案。该方法也激励未来工作探索更强的形态句法约束及人类导向的保守编辑评估。
引用
@article{arxiv.2512.00219,
title = {Minimal-Edit Instruction Tuning for Low-Resource Indic GEC},
author = {Akhil Rajeev P},
journal= {arXiv preprint arXiv:2512.00219},
year = {2025}
}
备注
Submitted to AACL-IJCNLP Bhasha Workshop Shared Task1 :GEC