中文

对称行为正则化策略优化

机器学习 2025-12-02 v3 人工智能

摘要

行为正则化策略优化(BRPO)利用非对称(散度)正则化来缓解离线强化学习中的分布漂移。这篇文章首次研究了对称正则化的开放问题。我们展示,对称正则化不允许解析最优策略π\pi^*,这构成了实际用途的挑战。我们通过对Pearson-Vajda χn\chi^n散度的Taylor级数来近似π\pi^*,并指出只有当级数限制在n=5n=5时,才存在解析策略表达式。为了以数值稳定的方式计算解,我们提出对称散度损失的条件对称项进行Taylor展开,导致一种新算法:对称ff-Actor Critic(Sff-AC)。Sff-AC 在各种D4RL MuJoCo 任务中实现持续强劲的结果。此外,Sff-AC 避免了IQL、SQL、XQL和AWAC中观察到的按环境失败,为离线RL的更具多样性和有效性的正则化选择开输了可能性。

关键词

引用

@article{arxiv.2508.04225,
  title  = {Symmetric Behavior Regularized Policy Optimization},
  author = {Lingwei Zhu and Haseeb Shah and Zheng Chen and Yukie Nagai and Martha White},
  journal= {arXiv preprint arXiv:2508.04225},
  year   = {2025}
}