IRIS:交叉语言数学推理中的交错强化学习与递增阶段课程
计算与语言
2026-04-28 v1
摘要
课程学习有助于语言模型通过逐步增加任务难度来处理复杂推理。然而,这种方法往往难以在多语言和低资源环境中生成一致的分步推理,尤其是在从英文到印度语言的跨语言迁移受限的情况下。我们提出 IRIS:交错强化学习与递增阶段课程,一个两轴框架,将基于逐步更难问题的监督微调(垂直轴)与逆向课程强化学习相结合,以减少对分步指导的依赖(水平轴)。我们设计了一种综合奖励函数,结合正确性、步骤对齐、连续性和数值激励,通过 Group Relative Policy Optimization(GRPO)进行优化。我们发布了 CL-Math 数据集,包含 29k 个问题,涵盖英文、Hindi 和 Marathi 三种语言的步骤级标注。跨越标准基准和精选的多语言测试集,IRIS 均实现了性能提升,在数学推理任务中取得优异成绩,并在低资源和双语设置中取得显著提升,同时在高资源语言中也表现出适度的改进。
引用
@article{arxiv.2604.24114,
title = {IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning},
author = {Navya Gupta and Rishitej Reddy Vyalla and Avinash Anand and Chhavi Kirtani and Erik Cambria and Zhengchen Zhang and Zhengkui Wang and Timothy Liu and Aik Beng Ng and Simon See and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2604.24114},
year = {2026}
}
备注
Accepted in ACL main