中文

面向长时序操作任务的学习技能序列依赖策略

机器人学 2021-05-13 v1

摘要

近年来,机器人学界在使用深度强化学习(RL)进行机器人操作方面取得了实质性进展。长时序任务的有效学习仍是一个具有挑战性的课题。典型的基于RL的方法将长时序任务近似为马尔可夫决策过程,且仅将当前观测(图像或其他传感器信息)作为输入状态。然而,这种近似忽略了技能序列在长时序任务中也起关键作用这一事实。在本文中,我们同时考虑观测与技能序列,并提出一种技能序列依赖的分层策略来解决典型的长时序任务。所提策略由高层技能策略(利用技能序列)和低层参数策略(响应观测)及相应的训练方法组成,使学习具有更高的样本效率。仿真实验表明,我们的方法成功解决了长时序任务,且显著快于近端策略优化(PPO)与任务模式方法。

关键词

引用

@article{arxiv.2105.05484,
  title  = {Learning a Skill-sequence-dependent Policy for Long-horizon Manipulation Tasks},
  author = {Zhihao Li and Zhenglong Sun and Jionglong SU and Jiaming Zhang},
  journal= {arXiv preprint arXiv:2105.05484},
  year   = {2021}
}