中文

用于高效机器人视觉运动技能学习的深度内在动机连续 Actor-Critic 方法

机器学习 2019-02-19 v2 人工智能 机器人学

摘要

在本文中,我们提出了一种新的内在动机 actor-critic 算法,用于直接从原始视觉输入中学习连续运动技能。我们的神经架构由一个评论家网络和一个行动者网络组成。两个网络都接收深度卷积自编码器的隐藏表示,该自编码器被训练来重建视觉输入,同时最中心的隐藏表示也被优化以估计状态值。此外,一组预测世界模型根据其学习进度生成内在奖励信号,该信号与外在奖励结合以引导 actor-critic 学习器的探索。我们的方法比现有的从像素数据进行连续控制的 actor-critic 方法更具数据效率且本质上更稳定。我们在逼真的物理模拟器和人形机器人上评估了我们的算法在学习机器人到达与抓取技能任务上的表现。结果表明,在稠密奖励和具有挑战性的稀疏奖励设置下,用我们的方法学到的控制策略都比所比较的先进方法和基线算法取得更好的性能。

关键词

引用

@article{arxiv.1810.11388,
  title  = {Deep Intrinsically Motivated Continuous Actor-Critic for Efficient Robotic Visuomotor Skill Learning},
  author = {Muhammad Burhan Hafez and Cornelius Weber and Matthias Kerzel and Stefan Wermter},
  journal= {arXiv preprint arXiv:1810.11388},
  year   = {2019}
}