中文

基于强化学习的路径规划:一种策略迭代方法

机器学习 2023-03-15 v1 人工智能 机器人学

摘要

随着实时处理的影响在近来得以显现,对强化学习算法高效实现的需求不断上升。尽管强化学习算法中使用的贝尔曼方程具有诸多优势,但其设计参数存在巨大的搜索空间。本研究旨在阐明与强化学习参数相关的设计空间探索,特别是策略迭代的参数。鉴于微调强化学习算法参数所需的计算开销巨大,我们提出一种基于自动调优器的序数回归方法,以加速这些参数的探索过程,进而加速向最优策略的收敛。与先前最先进(state-of-the-art, SOTA)方法相比,我们的方法实现了1.82倍的峰值加速,平均加速为1.48倍。

关键词

引用

@article{arxiv.2303.07535,
  title  = {Path Planning using Reinforcement Learning: A Policy Iteration Approach},
  author = {Saumil Shivdikar and Jagannath Nirmal},
  journal= {arXiv preprint arXiv:2303.07535},
  year   = {2023}
}