中文

$\mathrm{SO}(2)$-等变强化学习

机器人学 2022-03-10 v1

摘要

等变神经网络在其卷积层结构中强制施加对称性,从而在学习的等变或不变函数时显著提升样本效率。此类模型适用于机器人操作学习,其常可表述为旋转对称问题。本文在 QQ-学习与 actor-critic 强化学习的背景下研究等变模型架构。我们辨识最优 QQ-函数与最优策略的等变与不变特性,并提出利用该结构的等变 DQN 与 SAC 算法。我们给出的实验表明,在一类重要的机器人操作问题上,我们的等变版 DQN 与 SAC 比对比算法显著更具样本效率。

关键词

引用

@article{arxiv.2203.04439,
  title  = {$\mathrm{SO}(2)$-Equivariant Reinforcement Learning},
  author = {Dian Wang and Robin Walters and Robert Platt},
  journal= {arXiv preprint arXiv:2203.04439},
  year   = {2022}
}

备注

Published at ICLR 2022