表现性策略梯度:表现性强化学习中的最优性
机器学习
2026-02-03 v2 人工智能
最优化与控制
摘要
部署后的机器学习算法常常影响其所处的环境,从而改变标准强化学习(RL)方法所忽略的底层动态。虽然近期有研究探讨了在表现性场景下设计最优算法,但RL的 corresponding问题仍未得到充分探索。本文证明了RL中表现性版本的性能差异引理和策略梯度定理,并提出了表现性策略梯度算法(PePG)。PePG是首个旨在考虑RL中表现性因素的策略梯度算法。在软max参数化下,以及在有无熵正则化的情况下,我们证明了PePG收敛于表现性最优政策,即这些政策在由自身引起的分布迁移下仍保持最优。因此,PePG显著扩展了在表现性RL中实现表现性稳定性但非最优性的先前工作。此外,我们在标准表现性RL环境中的经验分析验证了PePG在旨�获得稳定性的最新表现性RL算法方面具有优势。
引用
@article{arxiv.2512.20576,
title = {Performative Policy Gradient: Optimality in Performative Reinforcement Learning},
author = {Debabrota Basu and Udvas Das and Brahim Driss and Uddalak Mukherjee},
journal= {arXiv preprint arXiv:2512.20576},
year = {2026}
}