中文

基于视觉的机器人学中通过奖励机实现规划与控制的分离

机器人学 2021-01-01 v1 人工智能

摘要

在这项工作中,我们为 Deep Q-Learning 智能体增强一个奖励机(DQRM),以加速基于视觉的机器人任务策略的学习,并克服 DQN 的一些阻碍其收敛到高质量策略的局限。奖励机(RM)是一个有限状态机,它将任务分解为离散规划图,并为智能体配备奖励函数以引导其完成任务。该奖励机既可用于奖励塑造,也可告知策略其当前所处的抽象状态。抽象状态是当前状态的高层简化,由任务相关特征定义。来自奖励机的奖励塑造与当前抽象状态知识这两种监督信号相互补充,二者均可用于提升策略性能,如若干基于视觉的机器人抓取与放置任务所示。特别是对于基于视觉的机器人应用,构建奖励机往往比试图让策略在无此结构下学习任务更为容易。

关键词

引用

@article{arxiv.2012.14464,
  title  = {Disentangled Planning and Control in Vision Based Robotics via Reward Machines},
  author = {Alberto Camacho and Jacob Varley and Deepali Jain and Atil Iscen and Dmitry Kalashnikov},
  journal= {arXiv preprint arXiv:2012.14464},
  year   = {2021}
}

备注

Accepted to the Deep Reinforcement Learning Workshop at Neural Information Processing Systems (2020)