中文

超越动态规划

机器学习 2023-06-28 v1 人工智能 机器人学

摘要

在本文中,我们提出 Score-life 规划,一种用于求解强化学习问题的新理论方法。与经典的基于动态规划的方法不同,我们的方法可以搜索非平稳策略函数,并能够直接从给定状态计算最优无限 horizon 动作序列。我们方法的核心思想是在无限 horizon 动作序列与有界区间中的实数之间构造一个映射。这一构造使我们能够构建一个优化问题,用于直接计算最优无限 horizon 动作序列,而无需策略函数。我们通过将该方法应用于非线性最优控制问题来展示其有效性。总体而言,我们的贡献为制定和求解强化学习问题提供了一种新的理论框架。

关键词

引用

@article{arxiv.2306.15029,
  title  = {Beyond dynamic programming},
  author = {Abhinav Muraleedharan},
  journal= {arXiv preprint arXiv:2306.15029},
  year   = {2023}
}

备注

17 pages. Colab Notebook: https://colab.research.google.com/drive/1GKIMieKrYLX_YXnUOFuEvHwk8CH26zVu?usp=sharing github repo/code: https://github.com/Abhinav-Muraleedharan/Beyond_Dynamic_Programming.git