中文

Agnostics: 通过通用学习环境进行强化学习的任意编程语言代码学习

机器学习 2026-03-24 v3 编程语言

摘要

大型语言模型(LLM)已在诸如 Python 和 JavaScript 等高资源语言中擅长编写代码, 但在对科学与工程至关重要的低资源语言时仍显得吃力。除了数据训练不足外, 后训练本身也成为瓶颈: 每种新语言似乎都需要新的数据集、测试框架以及强化学习(RL)基础设施。我们引入 Agnostics, 一个语言无关的后训练管道, 以消除这种按语言工程化的困扰。核心思想是仅通过其外部可观察行为来判断代码, 因此单个验证器即可测试任何语言所编写的解决方案。具体而言, 我们(1) 使用 LLM 将现有单元测试数据集重写为 I/O 格式, (2) 提供简短配置以指示验证器如何编译和运行目标语言, (3) 在健壮的代码执行环境中应用可验证奖励的强化学习(RLVR)。应用于 Lua、Julia、R、OCaml 和 Fortran 等五种低资源语言时, Agnostics(1) 将 Qwen-3 4B 提升至与其他 16B-70B 开源模型相当的性能; (2) 能平滑扩展至更大且多样化的模型家族(Qwen-3 8B、DeepSeek Coder 6.7B Instruct、Phi 4 Mini); (3) 对于参数≤16B的模型, 在 MultiPL-E 和我们引入的全新多语言版 LiveCodeBench 上均取得新纪录的 pass@1 结果。我们发布了语言无关的训练数据集(Ag-MBPP-X、Ag-Codeforces-X、Ag-LiveCodeBench-X)、训练代码以及即插即用的配置, 使任何编程语言的 RL 后训练都如同编辑简短的 YAML 文件一样简单。

关键词

引用

@article{arxiv.2508.04865,
  title  = {Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment},
  author = {Aleksander Boruch-Gruszecki and Yangtian Zi and Zixuan Wu and Tejas Oberoi and Carolyn Jane Anderson and Joydeep Biswas and Arjun Guha},
  journal= {arXiv preprint arXiv:2508.04865},
  year   = {2026}
}

备注

30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me