用于四旋翼控制的增强随机搜索:强化学习的一种替代方案
机器学习
2019-12-02 v1 人工智能
机器人学
摘要
基于模型的强化学习策略被认为比用于控制动态系统(如四旋翼)的无模型策略具有更显著的样本复杂度。那种认为涉及使用训练良好的神经网络做高层决策的基于模型策略总能给出更好性能的看法,可通过采用无模型策略搜索方法来消除。本文提出使用一种称为增强随机搜索(Augmented Random Search, ARS)的无模型随机搜索策略,它是用于如控制四旋翼飞行等连续控制任务的线性策略训练的更优且更快的方法。该方法通过免去使用过多数据训练先前四旋翼控制任务方法中存在的神经网络,达到了最先进的精度。本文还借助仿真,在策略性设计的任务环境中突出了该搜索策略用于此任务的性能结果。将增强随机搜索在 1000 个回合中的奖励收集表现及飞行中智能体行为与最先进强化学习算法深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)的行为进行比较。我们的仿真与结果表明,此类任务样本效率的常用策略性能差异很大,但 ARS-Quad 所构建的策略网络可对阶跃响应作出相对准确的反应,为强化学习策略提供了一种性能更优的替代方案。
引用
@article{arxiv.1911.12553,
title = {Augmented Random Search for Quadcopter Control: An alternative to Reinforcement Learning},
author = {Ashutosh Kumar Tiwari and Sandeep Varma Nadimpalli},
journal= {arXiv preprint arXiv:1911.12553},
year = {2019}
}
备注
10 pages. 11 figures, Published in International Journal of Information Technology and Computer Science(IJITCS), http://www.mecs-press.org/ijitcs