面向参数化动作空间的基于模型的强化学习
机器学习
2024-05-27 v3 人工智能
摘要
我们提出了一种新颖的基于模型的强化学习算法——参数化动作的动力学学习与预测控制(Dynamics Learning and predictive control with Parameterized Actions, DLPA),用于参数化动作马尔可夫决策过程。智能体学习一个以参数化动作为条件的动力学模型,并使用改进的模型预测路径积分控制进行规划。我们通过 Lipschitz 连续性的视角,在理论上从所获价值的角度量化了规划过程中生成的轨迹与最优轨迹之间的差异。我们在多个标准基准上的实证结果表明,与最先进的 PAMDP 方法相比,我们的算法实现了更优的样本效率和渐近性能。
引用
@article{arxiv.2404.03037,
title = {Model-based Reinforcement Learning for Parameterized Action Spaces},
author = {Renhao Zhang and Haotian Fu and Yilin Miao and George Konidaris},
journal= {arXiv preprint arXiv:2404.03037},
year = {2024}
}