中文

强化学习中的近似等变性

机器学习 2025-04-24 v2

摘要

等变神经网络在强化学习中取得了巨大成功,当任务中存在对称性时提高了样本效率和泛化能力。然而,在许多问题中,仅存在近似对称性,这使得施加精确对称性不恰当。近期,针对监督分类和物理系统建模提出了近似等变网络。在这项工作中,我们开发了强化学习(RL)中的近似等变算法。我们定义了近似等变 MDP,并在理论上刻画了近似等变性对最优 QQ 函数的影响。我们提出了使用松弛群和 steerable 卷积的新型 RL 架构,并在多个连续控制领域和带有真实金融数据的股票交易上进行了实验。我们的结果表明,当精确对称性存在时,近似等变网络的表现与精确等变网络持平,而在领域表现出近似对称性时则优于它们。作为这些技术的附加副产品,我们观察到测试时对噪声的鲁棒性增强。我们的代码在 https://github.com/jypark0/approx_equiv_rl 上公开可用。

关键词

引用

@article{arxiv.2411.04225,
  title  = {Approximate Equivariance in Reinforcement Learning},
  author = {Jung Yeon Park and Sujay Bhatt and Sihan Zeng and Lawson L. S. Wong and Alec Koppel and Sumitra Ganesh and Robin Walters},
  journal= {arXiv preprint arXiv:2411.04225},
  year   = {2025}
}

备注

AISTATS 2025