中文

HAEPO:历史聚合探索性策略优化

机器学习 2025-08-27 v1 人工智能

摘要

探索在现代学习中至关重要,从采用小型神经策略的强化学习环境到大型语言模型(LLM)皆是如此。现有工作(如DPO)利用全序列对数似然来捕捉模型决策的完整轨迹,而GRPO等方法则将逐 token 比率聚合为轨迹级更新。然而,两者往往都限制了在长视野任务上的探索。我们引入了历史聚合探索性策略优化(HAEPO),一种具有历史感知的探索性损失函数,以克服这些缺陷。HAEPO将每条轨迹压缩为其对数概率之和(累积对数似然),并在轨迹之间应用 Plackett-Luce softmax 以获得与其回报成正比的归一化权重,从而鼓励更广泛的探索。我们添加了熵正则化以稳定激进的更新,防止过早坍缩,并施加了相对于先前(参考)策略冻结副本的软 KL 惩罚。在实验上,HAEPO 收敛迅速、探索充分、与真实奖励紧密对齐,并在多种任务中展现出与 PPO、GRPO 和 DPO 相当或更优的鲁棒学习行为。因此,HAEPO 通过显式利用全轨迹历史并平衡探索与稳定性,提供了一个稳定且可解释的框架。

关键词

引用

@article{arxiv.2508.18884,
  title  = {HAEPO: History-Aggregated Exploratory Policy Optimization},
  author = {Gaurish Trivedi and Alakh Sharma and Kartikey Singh Bhandari and Dhruv Kumar and Pratik Narang and Jagat Sesh Challa},
  journal= {arXiv preprint arXiv:2508.18884},
  year   = {2025}
}

备注

Under review