中文

Genius:面向高级推理的可泛化且纯无监督的自训练框架

计算与语言 2025-04-14 v1 人工智能 机器学习

摘要

提升 LLM 的推理能力引起了广泛关注。然而,当前的后训练技术严重依赖监督信号,如结果监督或辅助奖励模型,面临着可扩展性差与标注成本高的问题。这促使我们在无需外部监督的情况下增强 LLM 推理。我们提出了一个可泛化且纯无监督的自训练框架,命名为 Genius。在没有任何外部辅助的情况下,Genius 需要以逐步的方式寻求最优响应序列并优化 LLM。为了探索潜在步骤并利用最优步骤,Genius 引入了逐步前瞻重采样策略,通过模拟未来结果来采样并估计步骤价值。此外,我们认识到无监督设定不可避免地会引入内在噪声与不确定性。为了提供稳健的优化,我们提出了优势校准优化(ACO)损失函数,以缓解估计不一致性。将这些技术结合在一起,Genius 为使用通用查询且无需监督的自改进 LLM 推理迈出了进阶的一步,鉴于通用查询的海量可用性,有望革新推理的扩展规律。代码将在 https://github.com/xufangzhi/Genius 发布。

关键词

引用

@article{arxiv.2504.08672,
  title  = {Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning},
  author = {Fangzhi Xu and Hang Yan and Chang Ma and Haiteng Zhao and Qiushi Sun and Kanzhi Cheng and Junxian He and Jun Liu and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2504.08672},
  year   = {2025}
}

备注

14 pages, 7 figures