用于端到端感觉运动学习的神经动态策略
机器学习
2020-12-07 v1 人工智能
计算机视觉与模式识别
机器人学
机器学习
摘要
当前感觉运动控制的主导范式,无论是模仿学习还是强化学习,都是直接在原始动作空间(如力矩、关节角或末端执行器位置)中训练策略。这迫使智能体在训练的每个时间步单独做出决策,从而限制了对连续、高维和长时域任务的可扩展性。相比之下,经典机器人研究长期以来利用动力系统作为策略表示,通过示教来学习机器人行为。然而,这些技术缺乏深度学习或强化学习所提供的灵活性与泛化能力,并在此类设置中未得到充分探索。在这项工作中,我们开始弥补这一差距,通过二阶微分方程重新参数化动作空间,将动力系统的结构嵌入基于深度神经网络的策略中。我们提出了神经动态策略(NDPs),其在轨迹分布空间中进行预测,而先前的策略学习方法中的动作表示原始控制空间。所嵌入的结构允许在强化和模仿学习设置下进行端到端策略学习。我们表明,在模仿和强化学习设置的若干机器人控制任务中,NDPs 在效率或性能方面均优于先前的最先进水平。项目视频与代码见 https://shikharbahl.github.io/neural-dynamic-policies/
引用
@article{arxiv.2012.02788,
title = {Neural Dynamic Policies for End-to-End Sensorimotor Learning},
author = {Shikhar Bahl and Mustafa Mukadam and Abhinav Gupta and Deepak Pathak},
journal= {arXiv preprint arXiv:2012.02788},
year = {2020}
}
备注
NeurIPS 2020 (Spotlight). Code and videos at https://shikharbahl.github.io/neural-dynamic-policies/