基于新哈密顿-雅可比-班尔挥掌型的双目标强化学习
人工智能
2025-12-05 v2 系统与控制
系统与控制
摘要
强化学习(RL)中的硬约束常会降低策略性能。拉格朗日方法可用于约束与目标的混合,但需要复杂的奖励工程和参数调优。在本工作中,我们延续将哈密顿-雅可比(HJ)方程与RL联系的最新进展,提出两种新型价值函数以实现双目标满足。具体包括:1) 达成不同奖励阈值和惩罚阈值的到达-始终-避免(RAA)问题;2) 达成两个不同奖励阈值的到达-到达(RR)问题。与时序逻辑方法通常涉及自动机表示不同,本文通过分解推导出显式且可计算的Bellman形式。我们证明,RAA和RR问题可重写为先前研究的HJ-RL问题的组合。基于此分析,我们提出了一种变体型近端策略优化算法(DOHJ-PPO),并表明其产生的行为在成功性、安全性和速度上均优于多个基线,适用于安全到达和多目标实现等任务。
引用
@article{arxiv.2506.16016,
title = {Dual-Objective Reinforcement Learning with Novel Hamilton-Jacobi-Bellman Formulations},
author = {William Sharpless and Dylan Hirsch and Sander Tonkens and Nikhil Shinde and Sylvia Herbert},
journal= {arXiv preprint arXiv:2506.16016},
year = {2025}
}