为时序扩展任务组合多样化策略
机器人学
2020-02-18 v3 机器学习
摘要
针对时序扩展与序列化任务的机器人控制策略通常以不同局部动力学之间的不连续切换为特征。这些变更点常在分层运动规划中被利用,以构建近似模型并促进区域特异性局部控制器的设计。然而,对于复杂的时序扩展任务,实现此类流水线在组合上变得极具挑战,尤其是当子控制器工作于不同的信息流、时间尺度和动作空间时。本文提出一种可组合包含运动规划轨迹、动态运动基元与神经网络控制器的多样化策略的方法。我们引入一种全局目标评分估计器,利用局部的、逐运动基元动力学模型及相应的激活状态空间集合,以局部最优方式对多样化策略进行排序。我们利用专家示范将通常被视为基于梯度的学习过程转化为规划过程,而无需显式指定前置与后置条件。我们首先使用一个 MDP 基准展示所提框架对动作与模型动力学失配的鲁棒性,随后在一个特别复杂的物理齿轮装配任务中于 PR2 机器人上予以求解。我们表明所提方法成功发现了控制器的最优序列并高效地解决了两项任务。
引用
@article{arxiv.1907.08199,
title = {Composing Diverse Policies for Temporally Extended Tasks},
author = {Daniel Angelov and Yordan Hristov and Michael Burke and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:1907.08199},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:1906.10099