中文

空间动作空间中的等变 $Q$ 学习

机器人学 2021-11-01 v1

摘要

近来,多种新的等变神经网络模型架构被提出,其相比标准模型能更好地对旋转与反射对称性进行泛化。这些模型与机器人学相关,因为许多机器人学问题可以以旋转对称的方式表达。本文关注视觉状态空间与空间动作空间上的等变性——即机器人动作空间包含 SE(2)\rm{SE}(2) 子集的设定。在此情形下,我们事先知晓状态图像中的旋转与平移应导致最优策略的空间动作维度中相同的旋转与平移。因此,我们可以使用等变模型架构使 QQ 学习更具采样效率。本文确定了最优 QQ 函数等变的条件,并针对该设定提出 QQ 网络架构。我们通过实验表明,该方法在一组具有挑战性的操作问题中优于标准方法。

关键词

引用

@article{arxiv.2110.15443,
  title  = {Equivariant $Q$ Learning in Spatial Action Spaces},
  author = {Dian Wang and Robin Walters and Xupeng Zhu and Robert Platt},
  journal= {arXiv preprint arXiv:2110.15443},
  year   = {2021}
}

备注

Accepted at Conference on Robot Learning (CoRL) 2021