中文

Loong:通过验证器大规模合成长链思维

机器学习 2025-09-04 v1 人工智能

摘要

近期大型语言模型(LLM)的进展表明,其推理能力可通过可验证奖励的强化学习(RLVR)显著提升,特别是在数学和编程等领域,因为这些领域的真实正确性可以自动评估。然而,将这一成功扩展到其他推理密集型领域仍然具有挑战性,原因在于高质量、可验证数据集的稀缺以及人工监督的高成本。在本工作中,我们介绍了 Loong 项目:一个用于跨多种推理密集型领域进行可扩展合成数据生成与验证的开源框架。该框架由两个关键组件组成:(1)LoongBench,一个经过精心整理的种子数据集,包含 8,729 个人工验证的示例,涵盖 12 个领域(如高等数学、化学、逻辑),每个示例都配有可执行代码和丰富的元数据;以及(2)LoongEnv,一个模块化的合成数据生成环境,支持多种提示策略来生成新的问答-代码三元组。这些组件共同构成了一个智能体-环境循环,使强化学习成为可能,其中基于 LLM 的智能体因生成与代码执行答案一致的思维链(CoT)解决方案而获得奖励。在经验上,我们在广泛的开放源代码和专有 LLM 套件上对 LoongBench 进行了基准测试,以评估领域覆盖范围并揭示性能瓶颈。此外,我们对 LoongEnv 生成的合成数据进行了全面分析,考察了正确性、难度和多样性。代码和文档可在 https://github.com/camel-ai/loong 获取。

关键词

引用

@article{arxiv.2509.03059,
  title  = {Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers},
  author = {Xingyue Huang and Rishabh and Gregor Franke and Ziyi Yang and Jiamu Bai and Weijie Bai and Jinhe Bi and Zifeng Ding and Yiqun Duan and Chengyu Fan and Wendong Fan and Xin Gao and Ruohao Guo and Yuan He and Zhuangzhuang He and Xianglong Hu and Neil Johnson and Bowen Li and Fangru Lin and Siyu Lin and Tong Liu and Yunpu Ma and Hao Shen and Hao Sun and Beibei Wang and Fangyijie Wang and Hao Wang and Haoran Wang and Yang Wang and Yifeng Wang and Zhaowei Wang and Ziyang Wang and Yifan Wu and Zikai Xiao and Chengxing Xie and Fan Yang and Junxiao Yang and Qianshuo Ye and Ziyu Ye and Guangtao Zeng and Yuwen Ebony Zhang and Zeyu Zhang and Zihao Zhu and Bernard Ghanem and Philip Torr and Guohao Li},
  journal= {arXiv preprint arXiv:2509.03059},
  year   = {2025}
}