$\mathrm{SO}(2)$-等变强化学习
机器人学
2022-03-10 v1
摘要
等变神经网络在其卷积层结构中强制施加对称性,从而在学习的等变或不变函数时显著提升样本效率。此类模型适用于机器人操作学习,其常可表述为旋转对称问题。本文在 -学习与 actor-critic 强化学习的背景下研究等变模型架构。我们辨识最优 -函数与最优策略的等变与不变特性,并提出利用该结构的等变 DQN 与 SAC 算法。我们给出的实验表明,在一类重要的机器人操作问题上,我们的等变版 DQN 与 SAC 比对比算法显著更具样本效率。
引用
@article{arxiv.2203.04439,
title = {$\mathrm{SO}(2)$-Equivariant Reinforcement Learning},
author = {Dian Wang and Robin Walters and Robert Platt},
journal= {arXiv preprint arXiv:2203.04439},
year = {2022}
}
备注
Published at ICLR 2022