R-Zero:从零数据开始的自演化推理大语言模型
机器学习
2026-02-16 v4 人工智能
计算与语言
摘要
自演化大语言模型(LLM)通过自主生成、精炼和从自身经验中学习,为通往超级智能提供了可扩展的路径。然而,现有训练此类模型的方法仍严重依赖大量人工精选任务和标签,通常通过微调或强化学习实现,这构成了推动AI系统超越人类智慧能力的根本瓶颈。为克服这一限制,我们提出R-Zero——一个完全自主的框架,从头开始生成自身训练数据。该框架启动于单个基础大语言模型,初始化两个具有不同角色的独立模型:挑战者(Challenger)和求解者(Solver)。这两个模型分别进行优化,并通过交互共同演化:挑战者因提出接近求解者能力极限的任务而获得奖励,求解者因解决挑战者提出的日益具备挑战性的任务而获得奖励。该过程产生一种无需任何预存在任务和标签的、具有针对性且自我改进的课程。经实验证明,R-Zero在不同主干大语言模型上均显著提升了推理能力,例如将Qwen3-4B-Base在数学推理基准测试中提升+6.49,在通用领域推理基准测试中提升+7.54。
引用
@article{arxiv.2508.05004,
title = {R-Zero: Self-Evolving Reasoning LLM from Zero Data},
author = {Chengsong Huang and Wenhao Yu and Xiaoyang Wang and Hongming Zhang and Zongxia Li and Ruosen Li and Jiaxin Huang and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2508.05004},
year = {2026}
}