中文

利用已知不变性的强化学习

机器学习 2026-04-29 v2

摘要

在许多现实世界的强化学习(RL)问题中,环境表现出固有的对称性,可以利用这些对称性来提高学习效率。本文为将已知群对称性融入基于核的强化学习开发了一个理论和算法框架。我们提出了一种乐观最小二乘值迭代(LSVI)的对称感知变体,它利用不变核来编码奖励和转移动力学中的不变性。我们的分析为不变再生核希尔伯特空间(RKHS)的最大信息增益和覆盖数建立了新的界,明确量化了对称性带来的样本效率提升。在定制的Frozen Lake环境和二维布局设计问题上的实证结果证实了理论上的改进,表明对称感知强化学习比其标准核对应方法取得了显著更好的性能。这些发现强调了结构先验在设计更高效的强化学习算法中的价值。

关键词

引用

@article{arxiv.2511.03473,
  title  = {Reinforcement Learning Using known Invariances},
  author = {Alexandru Cioba and Aya Kayal and Laura Toni and Sattar Vakili and Alberto Bernacchia},
  journal= {arXiv preprint arXiv:2511.03473},
  year   = {2026}
}