Genius:面向高级推理的可泛化且纯无监督的自训练框架
计算与语言
2025-04-14 v1 人工智能
机器学习
摘要
提升 LLM 的推理能力引起了广泛关注。然而,当前的后训练技术严重依赖监督信号,如结果监督或辅助奖励模型,面临着可扩展性差与标注成本高的问题。这促使我们在无需外部监督的情况下增强 LLM 推理。我们提出了一个可泛化且纯无监督的自训练框架,命名为 Genius。在没有任何外部辅助的情况下,Genius 需要以逐步的方式寻求最优响应序列并优化 LLM。为了探索潜在步骤并利用最优步骤,Genius 引入了逐步前瞻重采样策略,通过模拟未来结果来采样并估计步骤价值。此外,我们认识到无监督设定不可避免地会引入内在噪声与不确定性。为了提供稳健的优化,我们提出了优势校准优化(ACO)损失函数,以缓解估计不一致性。将这些技术结合在一起,Genius 为使用通用查询且无需监督的自改进 LLM 推理迈出了进阶的一步,鉴于通用查询的海量可用性,有望革新推理的扩展规律。代码将在 https://github.com/xufangzhi/Genius 发布。
引用
@article{arxiv.2504.08672,
title = {Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning},
author = {Fangzhi Xu and Hang Yan and Chang Ma and Haiteng Zhao and Qiushi Sun and Kanzhi Cheng and Junxian He and Jun Liu and Zhiyong Wu},
journal= {arXiv preprint arXiv:2504.08672},
year = {2025}
}
备注
14 pages, 7 figures