基于 Eikonal 约束的层次化拟度量强化学习的目标到达
机器学习
2026-03-03 v2 机器人学
系统与控制
系统与控制
机器学习
摘要
目标条件强化学习(GCRL)通过将任务框架化为目标到达而非最大化手工设计的奖励信号来缓解奖励设计的困难。在该设置中,最优目标条件值函数自然形成拟度量,这启发了拟度量强化学习(QRL),其将值学习约束为拟度量映射,并通过基于离散、轨迹的约束强制局部一致性。我们提出了 Eikonal 约束拟度量强化学习(Eik-QRL),这是基于 Eikonal 偏微分方程(PDE)的 QRL 连续时间重构。这种基于 PDE 的结构使 Eik-QRL 无需轨迹,仅需要采样状态和目标,同时提高了分布外泛化能力。我们为 Eik-QRL 提供了理论保证,并识别了在复杂动力学下出现的局限性。为应对这些挑战,我们引入了 Eik-Hierarchical QRL(Eik-HiQRL),将 Eik-QRL 集成到层次化分解中。经验上,Eik-HiQRL 在离线目标条件导航中达到了最先进的性能,并在操作任务中相对于 QRL 实现了稳定的提升,与时序差分方法相当。
引用
@article{arxiv.2512.12046,
title = {Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning},
author = {Vittorio Giammarino and Ahmed H. Qureshi},
journal= {arXiv preprint arXiv:2512.12046},
year = {2026}
}