连续动作、状态与时间中的值迭代
机器学习
2021-05-12 v1 机器人学
系统与控制
系统与控制
摘要
经典的值迭代方法不适用于具有连续状态和动作的环境。对于此类环境,状态和动作通常被离散化,这导致计算复杂度呈指数增长。在本文中,我们提出连续拟合值迭代(cFVI)。该算法使得在具有已知动力学模型的连续状态和动作上能够进行动态规划。利用连续时间公式,可以推导出针对非线性控制仿射动力学的最优策略。该闭式解使得值迭代能够高效扩展到连续环境。我们在非线性控制实验中表明,动态规划解在仿真中与深度强化学习方法取得相同的定量性能,但在迁移到物理系统时表现更优。尽管cFVI仅使用确定性模型且未在优化中显式纳入鲁棒性,其所获得的策略对动力学变化更具鲁棒性。物理系统的视频可在 \url{https://sites.google.com/view/value-iteration} 获取。
引用
@article{arxiv.2105.04682,
title = {Value Iteration in Continuous Actions, States and Time},
author = {Michael Lutter and Shie Mannor and Jan Peters and Dieter Fox and Animesh Garg},
journal= {arXiv preprint arXiv:2105.04682},
year = {2021}
}
备注
Accepted at International Conference on Machine Learning (ICML) 2021