通过目标参数化深度强化学习习得目标堆叠技能
机器人学
2017-11-23 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
理解物理现象是人类智能的关键组成部分,并使得与先前未见过的环境进行物理交互成为可能。本文中,我们研究人工智能体如何通过与环境交互自主获得这种直觉。我们创建了一个带物理模拟的合成积木堆叠环境,其中智能体可通过试错端到端地学习策略。由此,我们避开了在策略中显式建模物理知识。我们特别感兴趣于要求智能体达到给定目标状态且每次新试验可能不同的任务。为此,我们提出一种深度强化学习框架,学习由目标参数化的策略。我们在网格世界中具有不同目标位置的导航玩具示例以及具有不同最终塔目标结构的积木堆叠任务上验证了模型。与先前工作相比,我们的策略在不同目标上展现出更好的泛化能力。
引用
@article{arxiv.1711.00267,
title = {Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning},
author = {Wenbin Li and Jeannette Bohg and Mario Fritz},
journal= {arXiv preprint arXiv:1711.00267},
year = {2017}
}