中文

Hista 与 Numca:用于 LLM 强化学习的有效状态价值估计

机器学习 2026-05-29 v1 人工智能 计算与语言

摘要

强化学习(RL)通过奖励信号直接优化大语言模型(LLMs)的行为。虽然准确的状态价值估计对经典 RL 中的稳定训练至关重要,但在 LLM 后训练中仍是一个备受忽视的挑战。本文引入了状态价值估计基准测试(SVEB)来评估现有 RL 框架中的状态估计,表明标准方法如 PPO 中的批评家会退化为粗糙的群均值基线。为此,我们提出了两种技术:Numca 利用数值跨度作为可分级里程碑进行状态价值估计;以及 Hista,一个利用 LLM 隐藏状态作为表示,对离散 rollout 及其回报进行加权平均的框架。大量实验表明,这两种方法均能提供更准确的状态价值估计,并在不同的 RL 算法和模型规模上提升训练性能,同时不会带来显著的计算开销。

关键词

引用

@article{arxiv.2605.29782,
  title  = {Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning},
  author = {Zizhe Chen and Jiqian Dong and Yizhou Tian and Garry Yang and Yongqiang Chen and Zhitang Chen and James Cheng},
  journal= {arXiv preprint arXiv:2605.29782},
  year   = {2026}
}

备注

Accepted at ICML 2026