中文

面向可表现性最优策略的可表现性强化学习

机器学习 2025-10-07 v1 最优化与控制

摘要

可表现性强化学习是一种新兴的动态决策框架,将强化学习扩展到代理的政策能够改变环境动力学的常见应用场景。现有的可表现性强化学习工作仅致力于寻找可表现稳定 (PS) 的政策,即最大化近似价值函数的政策。然而,存在一个在 PS 政策与所需的可表现最优 (PO) 政策之间存在可证明的正常数间隙的事实,即后者最大化原始价值函数。在 contrast,本文提出了一种零阶 Frank-Wolfe 算法 (0-FW),其中包含对可表现性政策梯度的零阶近似,并在 Frank-Wolfe 框架中获得了**首次**在标准正则化支配条件下对所需 PO 政策的多项式时间收敛。对于收敛分析,我们证明了非凸价值函数的两个重要性质。首先,当政策正则化支配环境变化时,价值函数满足一定的梯度支配属性,因此任何平稳点 (非 PS) 的价值函数都是所需的 PO。其次,尽管价值函数具有无界梯度,我们证明了所有足够平稳的点位于一个凸且紧致的政策子空间 ΠΔ\Pi_{\Delta} 中,其中政策价值的下界为常数 Δ>0\Delta>0,因此梯度变得有界且满足 Lipschitz 连续性。实验结果也表明,我们的 0-FW 算法在寻找所需的 PO 政策方面优于现有算法。

关键词

引用

@article{arxiv.2510.04430,
  title  = {Achieve Performatively Optimal Policy for Performative Reinforcement Learning},
  author = {Ziyi Chen and Heng Huang},
  journal= {arXiv preprint arXiv:2510.04430},
  year   = {2025}
}