中文

通用效用强化学习中策略梯度方法的全局最优性

机器学习 2025-10-27 v3 人工智能

摘要

基于通用效用的强化学习(RLGU)提供了一个统一的框架,捕捉超越标准期望回报的多个问题,包括模仿学习、纯探索和安全强化学习。尽管近期在标准RL和RLGU的策略梯度(PG)方法理论分析方面取得了重要进展,但对这些PG算法及其在RLGU中的应用范围的理解仍有限。本文中,我们在目标为一般性凹效用函数的状态-动作占用度量的RLGU中,建立了PG方法的全局最优性保证。对于表格设置,我们提供全局最优性结果,采用一种基于最新理论发展的新型证明技术,即基于梯度支配的标准RL方法收敛分析。我们的证明技术为分析RLGU中超越直接策略参数化的其他参数化方法开辟了分析路径。此外,我们提供针对超大规模状态-动作空间设置的全局最优性结果,超越了此前主要聚焦于表格设置的工作。在此大规模设置中,我们通过在函数逼近类中使用最大似然估计来近似占用度量,改进了PG方法。我们的样本复杂度仅随我们逼近类的维度而增长,而非状态-动作空间的大小。

关键词

引用

@article{arxiv.2410.04108,
  title  = {On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning},
  author = {Anas Barakat and Souradip Chakraborty and Peihong Yu and Pratap Tokekar and Amrit Singh Bedi},
  journal= {arXiv preprint arXiv:2410.04108},
  year   = {2025}
}

备注

NeurIPS 2025 camera ready