基于地图的路径规划强化学习中的等变集成与正则化
机器学习
2024-12-31 v3 机器人学
摘要
在强化学习 (RL) 中,利用环境的对称性可以显著提升效率、鲁棒性和性能。然而,确保深度 RL 的策略与价值网络分别具备等变性与不变性以利用这些对称性是一项重大挑战。相关工作试图通过构造设计出等变与不变的网络,这将其局限于极其有限的组件库,进而妨碍了网络的表达能力。本文提出了一种无需专用神经网络组件即可构造等变策略与不变价值函数的方法,我们称之为等变集成。我们进一步添加了正则化项,以在训练过程中引入归纳偏置。在基于地图的路径规划案例研究中,我们展示了等变集成与正则化如何提升样本效率和性能。
引用
@article{arxiv.2403.12856,
title = {Equivariant Ensembles and Regularization for Reinforcement Learning in Map-based Path Planning},
author = {Mirco Theile and Hongpeng Cao and Marco Caccamo and Alberto L. Sangiovanni-Vincentelli},
journal= {arXiv preprint arXiv:2403.12856},
year = {2024}
}
备注
Accepted at IROS 2024. A video can be found here: https://youtu.be/L6NOdvU7n7s. The code is available at https://github.com/theilem/uavSim