多语言推理训练营:程序化推理环境的多语言扩展
计算与语言
2026-03-12 v1
摘要
我们提出了多语言推理训练营(Multilingual Reasoning Gym),这是对推理训练营(Stojanovski 等,2025)的扩展,能够在 14 种语言中程序化生成可验证的推理问题。我们在 10 种语言中以母语者验证方式翻译 94 项任务的模板,并针对代码或模板进行针对性修改,以确保语言的自然性。多语言推理训练营保留了原推理训练营所采用的程序化生成方法的核心优势,例如几乎无限的问题实例生成能力以及可调节的难度级别,且直接可用于强化学习可验证奖励和评估场景。由于程序化环境的特性,多语言推理训练营中的问题在语言间平行,能够实现大规模的跨语言平行数据生成。我们公开了实现代码,以支持多语言推理模型的研究。
引用
@article{arxiv.2603.10793,
title = {Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments},
author = {Konstantin Dobler and Simon Lehnerer and Federico Scozzafava and Jonathan Janke and Mohamed Ali},
journal= {arXiv preprint arXiv:2603.10793},
year = {2026}
}