绝对零度:零数据下的强化自博弈推理
机器学习
2025-10-17 v3 人工智能
计算与语言
摘要
基于可验证奖励的强化学习 (RLVR) 通过直接从结果奖励中学习,在增强大型语言模型的推理能力方面展现出潜力。近期在零设定下运行的 RLVR 工作避免了在标注推理过程时的监督,但仍依赖于人工策划的问题和答案集合进行训练。高质量、人工生成样本的稀缺性引发了对依赖人类监督的长期可扩展性的担忧,这一挑战在语言模型预训练领域已显而易见。此外,在一个假设的未来,人工智能超越人类智能,人类提供的任务可能为超智能系统提供有限的学习潜力。为解决这些担忧,我们提出了一种名为“绝对零度”的新 RLVR 范式,其中单一模型学习提出能最大化其自身学习进度的任务,并通过解决这些任务来提高推理能力,而不依赖任何外部数据。在此范式下,我们引入了绝对零度推理器 (AZR),这是一个通过使用代码执行器来验证提出的代码推理任务和验证答案,从而自我演化其训练课程和推理能力的系统,代码执行器作为统一的验证奖励源,引导开放式但有根基的学习。尽管完全在没有外部数据的情况下训练,AZR 在编码和数学推理任务上取得了整体最先进的性能,优于依赖数万个领域内人工策划样本的现有零数据设定模型。此外,我们证明 AZR 可以有效应用于不同模型规模,并与各种模型类别兼容。
引用
@article{arxiv.2505.03335,
title = {Absolute Zero: Reinforced Self-play Reasoning with Zero Data},
author = {Andrew Zhao and Yiran Wu and Yang Yue and Tong Wu and Quentin Xu and Yang Yue and Matthieu Lin and Shenzhi Wang and Qingyun Wu and Zilong Zheng and Gao Huang},
journal= {arXiv preprint arXiv:2505.03335},
year = {2025}
}