对称破缺环境中的部分等变强化学习
机器学习
2026-03-12 v2 机器人学
摘要
群对称为强化学习 (RL) 提供了强大的归纳偏置, 通过群不变MDP实现跨对称状态和动作的高效泛化。然而,现实世界环境几乎不实现完全的群不变MDP;动力学、执行限制和奖励设计通常只在局部破坏对称性。在此类情况下,对局部对称破坏进行群不变Bellman备份会引入误差,并在整个状态-动作空间中传播,导致全局价值估计误差。为此,我们引入部分群不变MDP (PI-MDP),根据对称性何处成立选择性地应用群不变或标准Bellman备份。该框架缓解了来自局部破坏对称性的误差传播,同时保持等变性的优势,从而增强样本效率和可泛化性。建立在此框架之上,我们present了实际的RL算法——针对离散控制的PE-DQN和针对连续控制的PE-SAC——将等变性的优势与对对称破坏的鲁棒性相结合。在Grid-World、运动学和操纵基准测试中实验表明,PE-DQN和PE-SAC显著优于基线方法,突显了针对鲁棒和高效RL的选择性对称性利用的重要性。项目页面: https://pranaboy72.github.io/perl_page/
引用
@article{arxiv.2512.00915,
title = {Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments},
author = {Junwoo Chang and Minwoo Park and Joohwan Seo and Roberto Horowitz and Jongmin Lee and Jongeun Choi},
journal= {arXiv preprint arXiv:2512.00915},
year = {2026}
}
备注
ICLR 2026