基于强化学习的路径规划:一种策略迭代方法
机器学习
2023-03-15 v1 人工智能
机器人学
摘要
随着实时处理的影响在近来得以显现,对强化学习算法高效实现的需求不断上升。尽管强化学习算法中使用的贝尔曼方程具有诸多优势,但其设计参数存在巨大的搜索空间。本研究旨在阐明与强化学习参数相关的设计空间探索,特别是策略迭代的参数。鉴于微调强化学习算法参数所需的计算开销巨大,我们提出一种基于自动调优器的序数回归方法,以加速这些参数的探索过程,进而加速向最优策略的收敛。与先前最先进(state-of-the-art, SOTA)方法相比,我们的方法实现了1.82倍的峰值加速,平均加速为1.48倍。
引用
@article{arxiv.2303.07535,
title = {Path Planning using Reinforcement Learning: A Policy Iteration Approach},
author = {Saumil Shivdikar and Jagannath Nirmal},
journal= {arXiv preprint arXiv:2303.07535},
year = {2023}
}