对称行为正则化策略优化
机器学习
2025-12-02 v3 人工智能
摘要
行为正则化策略优化(BRPO)利用非对称(散度)正则化来缓解离线强化学习中的分布漂移。这篇文章首次研究了对称正则化的开放问题。我们展示,对称正则化不允许解析最优策略,这构成了实际用途的挑战。我们通过对Pearson-Vajda 散度的Taylor级数来近似,并指出只有当级数限制在时,才存在解析策略表达式。为了以数值稳定的方式计算解,我们提出对称散度损失的条件对称项进行Taylor展开,导致一种新算法:对称-Actor Critic(S-AC)。S-AC 在各种D4RL MuJoCo 任务中实现持续强劲的结果。此外,S-AC 避免了IQL、SQL、XQL和AWAC中观察到的按环境失败,为离线RL的更具多样性和有效性的正则化选择开输了可能性。
引用
@article{arxiv.2508.04225,
title = {Symmetric Behavior Regularized Policy Optimization},
author = {Lingwei Zhu and Haseeb Shah and Zheng Chen and Yukie Nagai and Martha White},
journal= {arXiv preprint arXiv:2508.04225},
year = {2025}
}