中文

面向原语增强分层强化学习的直接偏好优化:双层方法

机器学习 2026-04-17 v4

摘要

分层强化学习(HRL)使智能体能够通过将复杂的长时序任务分解为可管理的子任务来求解。然而,HRL方法面临两个基本挑战:(i)训练过程中下层策略的演化所引起的非平稳性,使上层学习不稳定;(ii)生成下层策略无法实现的不可行子目标。为应对这些挑战,我们提出了DIPPER,一种新颖的HRL框架,将目标条件HRL表述为双层优化问题,并利用直接偏好优化(DPO)来训练上层策略。通过从子目标序列上的平稳偏好比较而非依赖于演化中下层策略的奖励中学习,DIPPER缓解了非平稳性对分层学习的影响。为解决不可行子目标问题,DIPPER引入了下层价值函数正则化,鼓励上层策略提出可实现的子目标。我们还引入了两个新指标来定量验证DIPPER在HRL中缓解非平稳性和不可行子目标生成问题的效果。我们在具有挑战性的机器人导航和操作基准上进行了实证评估,结果表明DIPPER相比最先进的基线实现了高达40%的提升,证明了基于偏好的方法可以有效缓解分层强化学习中持续存在的挑战。

关键词

引用

@article{arxiv.2411.00361,
  title  = {Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach},
  author = {Utsav Singh and Souradip Chakraborty and Wesley A. Suttle and Brian M. Sadler and Derrik E. Asher and Anit Kumar Sahu and Mubarak Shah and Vinay P. Namboodiri and Amrit Singh Bedi},
  journal= {arXiv preprint arXiv:2411.00361},
  year   = {2026}
}