G-Zero:从零数据出发面向开放式生成的自博弈
机器学习
2026-05-12 v1 人工智能
计算与语言
新兴技术
摘要
自我进化的 LLM 在可验证领域表现出色,但在开放式任务中却举步维艰,因为依赖代理 LLM 评判会引入能力瓶颈和奖励作弊。为了克服这一点,我们引入了 G-Zero,一个无需验证器、用于自主自我提升的协同进化框架。我们的核心创新是 Hint-,这是一种内在奖励,用于量化生成器模型在无辅助时的响应与其在自生成提示条件下的响应之间的预测偏移。利用这一信号,提议器模型通过 GRPO 进行训练,通过合成具有挑战性的查询和信息丰富的提示来持续针对生成器模型的盲点。生成器则通过 DPO 并行优化,以将这些提示引导的改进内化。在理论上,我们证明了 G-Zero 理想化的标准 DPO 版本的最佳迭代次优性保证,前提是提议器诱导了足够的探索覆盖且数据过滤保持了较低的伪标签分数噪声。通过完全从内部分布动力学中推导监督,G-Zero 绕过了外部评判者的能力上限,为在不可验证领域持续进行 LLM 自我进化提供了一条可扩展、稳健的路径。
引用
@article{arxiv.2605.09959,
title = {G-Zero: Self-Play for Open-Ended Generation from Zero Data},
author = {Chengsong Huang and Haolin Liu and Tong Zheng and Runpeng Dai and Langlin Huang and Jinyuan Li and Zongxia Li and Zhepei Wei and Yu Meng and Jiaxin Huang},
journal= {arXiv preprint arXiv:2605.09959},
year = {2026}
}