面向大规模带约束无标签运动规划的图策略梯度方法
机器人学
2019-09-25 v1 组合数学
摘要
本文提出一种学习方法,用于解决大量机器人在二维空间中带运动约束和空间约束的无标签运动问题。为解决任意动力学与约束问题,我们提议将该问题表述为多智能体问题。与以往提出使用学习方案解决带约束无标签运动规划的工作不同,我们能够证明所提方法在大量机器人情形下的可扩展性。处理大量机器人时遇到的维数灾难,通过采用图卷积神经网络(GCN)为机器人策略参数化得以缓解。GCN通过学习在机器人局部间聚合信息的滤波器来降低问题维数,类似于卷积神经网络在图像中学习局部特征的方式。此外,通过采用GCN,我们还能够通过先为少量机器人训练图滤波器,再零样本策略迁移到更多机器人,克服为大量机器人训练策略的计算开销。我们通过多种仿真展示了框架的有效性。
引用
@article{arxiv.1909.10704,
title = {Graph Policy Gradients for Large Scale Unlabeled Motion Planning with Constraints},
author = {Arbaaz Khan and Vijay Kumar and Alejandro Ribeiro},
journal= {arXiv preprint arXiv:1909.10704},
year = {2019}
}