最小人类监督下的引导式自演化大语言模型
人工智能
2025-12-03 v1 计算与语言
机器学习
摘要
AI 自演化长期被视为通用人工智能的实现路径,旨在使模型能够从自身的学习经验中自主获取、精炼并内化知识。然而在实际应用中,缺乏引导的自演化系统往往迅速达到平台期,甚至出现性能衰退。这些失败源于概念漂移、多样性崩溃和误演化等问题,模型会强化自身偏见,趋向低熵行为。为实现在最小依赖人类监督的情况下进行稳定可控的模型自演化,我们引入了 R-Few——一种引导式自我对弈挑战者-解答者框架,集成了通过 in-context grounding 和混合训练实现的轻量级人类监督。每一轮迭代中,挑战者从小规模的人类标注示例中采样,以指导合成问题的生成;而解答者则在人类与合成示例上进行在线训练,依据难度级别进行课程学习。在数学和常规推理基准测试中,R-Few 实现了持续且迭代的性能提升。例如,Qwen3-8B-Base 相较于 R-Zero 在数学任务上提升了 +3.0 分,并达到了与 General-Reasoner 相当的水平,尽管后者使用的人类数据是前者的 20 倍。消融实验确认了以 grounding 挑战者训练和基于课程的解答者训练的互补贡献,进一步分析显示,R-Few 能有效缓解概念漂移,实现更稳定可控的协同演化动力学。
引用
@article{arxiv.2512.02472,
title = {Guided Self-Evolving LLMs with Minimal Human Supervision},
author = {Wenhao Yu and Zhenwen Liang and Chengsong Huang and Kishan Panaganti and Tianqing Fang and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2512.02472},
year = {2025}
}