通过层次强化学习从 LLM 内部状态学习温度策略:探索向外
机器学习
2026-02-16 v1 人工智能
计算与语言
摘要
从可验证奖励训练的强化学习(RLVR)通过采样轨迹训练大语言模型(LLM),使解码策略成为学习的核心组件而非仅为推理时间选择。采样温度直接通过调制策略熵来控制探索-开发平衡,但现有方法依赖静态值或与任务级奖励分离的启发式调整。我们提出 Introspective LLM,一种层次强化学习框架,用于在生成期间学习控制采样温度的策略。在每个解码步骤中,模型根据其隐藏状态选择温度,并从结果分布中采样下一个标记。温度和标记策略均通过坐标上升方案从下游奖励联合优化。在数学推理基准测试上,学习到的温度策略在固定和启发式基准之上,表现出与推理不确定性相一致的可解释探索行为。
引用
@article{arxiv.2602.13035,
title = {Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL},
author = {Yixiao Zhou and Yang Li and Dongzhou Cheng and Hehe Fan and Yu Cheng},
journal= {arXiv preprint arXiv:2602.13035},
year = {2026}
}