大型语言模型强化微调中的熵动力学
机器学习
2026-02-04 v1 人工智能
摘要
熵作为衡量大型语言模型(LLM)生成输出多样性的关键指标,为提供有关其探索能力的宝贵见解。虽然近期研究越来越关注监控和调整熵以更好地平衡强化微调(RFT)中的探索与开发,但对熵在该过程中动力学的原则性理解尚未得到彻底考察。本文建立了一个用于分析 RFT 过程中熵动力学的理论框架,该框架从一个量化单次逻辑更新下熵变化的判别表达式开始。这一基础使我们能够导出熵变化的一阶表达式,可进一步推导出 Group Relative Policy Optimization(GRPO)的更新公式。来自理论分析的推论和见解启发了熵控制方法的设计,也为解释现有研究中各种基于熵的方法提供了统一的视角。我们提供实证证据支持我们分析的主要结论,并演示了所推导的熵判别器裁剪方法的有效性。该研究为 RFT 训练动力学带来新颖的见解,为在 LLM 微调期间优化探索-开发平衡提供理论支持和实用策略。
引用
@article{arxiv.2602.03392,
title = {On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models},
author = {Shumin Wang and Yuexiang Xie and Wenhao Zhang and Yuchang Sun and Yanxi Chen and Yaliang Li and Yanyong Zhang},
journal= {arXiv preprint arXiv:2602.03392},
year = {2026}
}