桥接物理信息神经网络与强化学习:哈密顿-雅可比-贝尔曼近端策略优化 (HJBPPO)
机器学习
2023-02-02 v1 人工智能
数值分析
偏微分方程分析
数值分析
最优化与控制
摘要
本文将哈密顿-雅可比-贝尔曼近端策略优化 (HJBPPO) 算法引入强化学习。哈密顿-雅可比-贝尔曼 (HJB) 方程在控制理论中用于评估值函数的最优性。我们的工作将 HJB 方程与连续状态和动作空间中的强化学习相结合,以改进值网络的训练。我们将值网络视为物理信息神经网络 (PINN),通过精确计算其关于输入的导数来求解 HJB 方程。近端策略优化 (PPO)-Clipped 算法借此实现得到改进,因其使用值网络为其策略网络计算目标函数。HJBPPO 算法在 MuJoCo 环境中相比 PPO 表现出更优的性能。
引用
@article{arxiv.2302.00237,
title = {Bridging Physics-Informed Neural Networks with Reinforcement Learning: Hamilton-Jacobi-Bellman Proximal Policy Optimization (HJBPPO)},
author = {Amartya Mukherjee and Jun Liu},
journal= {arXiv preprint arXiv:2302.00237},
year = {2023}
}