中文

桥接物理信息神经网络与强化学习:哈密顿-雅可比-贝尔曼近端策略优化 (HJBPPO)

机器学习 2023-02-02 v1 人工智能 数值分析 偏微分方程分析 数值分析 最优化与控制

摘要

本文将哈密顿-雅可比-贝尔曼近端策略优化 (HJBPPO) 算法引入强化学习。哈密顿-雅可比-贝尔曼 (HJB) 方程在控制理论中用于评估值函数的最优性。我们的工作将 HJB 方程与连续状态和动作空间中的强化学习相结合,以改进值网络的训练。我们将值网络视为物理信息神经网络 (PINN),通过精确计算其关于输入的导数来求解 HJB 方程。近端策略优化 (PPO)-Clipped 算法借此实现得到改进,因其使用值网络为其策略网络计算目标函数。HJBPPO 算法在 MuJoCo 环境中相比 PPO 表现出更优的性能。

关键词

引用

@article{arxiv.2302.00237,
  title  = {Bridging Physics-Informed Neural Networks with Reinforcement Learning: Hamilton-Jacobi-Bellman Proximal Policy Optimization (HJBPPO)},
  author = {Amartya Mukherjee and Jun Liu},
  journal= {arXiv preprint arXiv:2302.00237},
  year   = {2023}
}