中文

基于课程-GRPO 的难度感知孟加拉数学推理模型 GanitLLM

计算与语言 2026-04-21 v3 人工智能 机器学习

摘要

我们提出了名为 GanitLLM 的孟加拉数学推理模型(Ganit 源自孟加拉语中“数学”之意),并构建了一个新的难度感知孟加拉数学语料库以及基于课程的 GRPO 流水线。孟加拉是全球最常用语言之一,但现有大型语言模型要么在英语中推理后翻译,要么在多步骤孟加拉数学问题中难以胜任,这部分原因在于强化学习配方针对高资源语言调校,难以在低资源环境下应对奖励稀疏。为此,我们构建了 Ganit,一个经过严格筛选和去除噪声的孟加拉数学数据集,难度标签来源于强大评估模型的 pass@k。基于该数据集,我们提出 Curriculum-GRPO,将多阶段训练(SFT + GRPO)与难度感知抽样和可验证奖励(格式、数值正确性及孟加拉推理)相结合。在 Bn-MGSM 和 Bn-MSVAMP 上,GanitLLM-4B 相较于其 Qwen3-4B 基础模型提升了 8 和 6 个准确度点,孟加拉推理 token 比例从 14% 提升至 88% 以上,平均解题长度从 943 字缩减至 193 字。项目页面可在 https://dipta007.github.io/GanitLLM 查看。

关键词

引用

@article{arxiv.2601.06767,
  title  = {GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO},
  author = {Shubhashis Roy Dipta and Khairul Mahbub and Nadia Najjar},
  journal= {arXiv preprint arXiv:2601.06767},
  year   = {2026}
}

备注

Accepted at ACL 2026 (Findings)