面向机器人操作的深度强化学习:研究现状
机器人学
2017-02-01 v1 人工智能
摘要
本工作的重点是列举围绕强化学习在机器人操作任务中应用的各种方法与算法。早期方法利用专门的策略表示和人类示范来约束策略。这类方法在机器人的连续状态和策略空间中表现良好,但未能提出通用策略。随后,高维非线性函数逼近器(如神经网络)被用于从零开始学习策略。若干新颖且近期的方法还利用深度学习将控制策略与高效的感知表示相结合。这催生了称为深度强化学习(DRL)的动态机器人控制系统新分支。本工作涵盖了对最新算法、架构及其在仿真和真实世界机器人平台中实现的综述。DRL架构被划分为两个不同的分支,即离散动作空间算法(DAS)和连续动作空间算法(CAS)。此外,CAS算法被分为随机连续动作空间(SCAS)和确定性连续动作空间(DCAS)算法。除阐明DRL算法的组织外,本工作还展示了这些方法在机器人操作任务中的一些最先进应用。
引用
@article{arxiv.1701.08878,
title = {Deep Reinforcement Learning for Robotic Manipulation-The state of the art},
author = {Smruti Amarjyoti},
journal= {arXiv preprint arXiv:1701.08878},
year = {2017}
}
备注
18 pages