强化微调中的熵极性:方向、非对称性与控制
机器学习
2026-05-15 v2 计算与语言
摘要
策略熵已成为理解和控制基于可验证奖励的强化学习(RLVR)中大型语言模型探索行为的基本度量。然而,现有的熵感知方法主要通过全局目标来调节熵,而采样策略更新重塑策略熵的token级机制仍未被充分探索。本文中,我们构建了RLVR中熵力学的理论框架。我们的分析给出了熵变化的一阶近似,由此引出熵极性——一个有符号的token级量,用于预测一次采样更新会扩大还是收缩熵。该分析进一步揭示了一种结构非对称性:强化高频高概率token会触发收缩趋势,而扩张趋势通常需要低概率样本或更强的分布校正。实验表明,熵极性能够可靠地预测熵变化,且正、负极性分支在保持探索的同时加强利用方面发挥着互补作用。基于这些见解,我们提出了极性感知策略优化(PAPO),该方法保留了两个极性分支,并通过优势重加权实现熵控制。利用经验熵轨迹作为在线阶段信号,PAPO在熵扩张更新与熵收缩更新之间自适应地重新分配优化压力。在数学推理和智能体基准测试上的实验表明,PAPO持续优于竞争基线,同时提供了更优的训练效率和显著的奖励提升。
引用
@article{arxiv.2605.11775,
title = {Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control},
author = {Jiazheng Zhang and Ziche Fu and Junrui Shen and Yunbin Zhao and Yunke Zhang and Zhiheng Xi and Long Ma and Chenxin An and Zhihao Zhang and Shichun Liu and Dingwei Zhu and Shihan Dou and Shaofan Liu and Han Li and Wiggin Zhou and Aiden Adams and Tao Gui and Fei Huang and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2605.11775},
year = {2026}
}