基于自由能驱动的强化学习与自适应优势塑形用于无监督LLM推理
计算与语言
2026-05-08 v2 新兴技术
机器学习
摘要
无监督强化学习(RL)已成为启用大型语言模型(LLM)自我改进的有前景的范式,但现有的无监督RL方法往往缺乏适应模型在训练期间演变推理能力的能力。因此,这些方法在缺乏真实监督时可能误导策略优化。为此,我们提出FREIA,一个基于两个关键创新点的RL算法:(1)自由能驱动奖励(FER)根据自由能原理平衡共识与探索;(2)自适应优势塑形(AAS)根据抽样奖励的统计特征自适应调整学习信号。在九个数据集上的九个推理任务上的经验评估表明,FREIA优于其他无监督RL基线方法。值得注意的是,在数学推理任务中,FREIA使用DeepSeek-R1-Distill-Qwen-1.5B模型时,相较于其他方法在Pass@1上提升0.5至3.5个百分点。
引用
@article{arxiv.2605.04065,
title = {Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs},
author = {Yiming Huang and Zhenbo Shi and Xin-Cheng Wen and Jichuan Zeng and Cuiyun Gao and Peiyi Han and Chuanyi Liu},
journal= {arXiv preprint arXiv:2605.04065},
year = {2026}
}
备注
Accepted by ACL 2026