超越动态规划
机器学习
2023-06-28 v1 人工智能
机器人学
摘要
在本文中,我们提出 Score-life 规划,一种用于求解强化学习问题的新理论方法。与经典的基于动态规划的方法不同,我们的方法可以搜索非平稳策略函数,并能够直接从给定状态计算最优无限 horizon 动作序列。我们方法的核心思想是在无限 horizon 动作序列与有界区间中的实数之间构造一个映射。这一构造使我们能够构建一个优化问题,用于直接计算最优无限 horizon 动作序列,而无需策略函数。我们通过将该方法应用于非线性最优控制问题来展示其有效性。总体而言,我们的贡献为制定和求解强化学习问题提供了一种新的理论框架。
引用
@article{arxiv.2306.15029,
title = {Beyond dynamic programming},
author = {Abhinav Muraleedharan},
journal= {arXiv preprint arXiv:2306.15029},
year = {2023}
}
备注
17 pages. Colab Notebook: https://colab.research.google.com/drive/1GKIMieKrYLX_YXnUOFuEvHwk8CH26zVu?usp=sharing github repo/code: https://github.com/Abhinav-Muraleedharan/Beyond_Dynamic_Programming.git