用于 $q_\pi$ 可实现约束 MDP 中的局部规划的自信自然策略梯度
机器学习
2024-12-11 v3
摘要
约束马尔可夫决策过程 (CMDP) 框架是一种重要的强化学习方法,用于在最大化累积奖励的同时施加安全或其他关键目标。然而,当前对如何在具有 potentially 无限状态数的 CMDP 环境中高效学习的理解仍不足,特别是当对价值函数应用函数逼近时。本文在 可实现性假设下解决了学习问题,即所有策略的价值函数都可用已知特征图线性表示,一种比其他线性设置更为一般且具有挑战性的情形。我们利用局部访问模型,提出了一种新的原始-对偶算法,该算法在 次查询后,以高概率输出一个严格满足约束且近� optimally 优化价值的策略。这里的 是特征维数, 是给定的误差。该算法依赖于精心构建的逆策略评估程序,使用历史数据对策略进行评估,从而通过策略梯度来更新策略并节省样本。据我们了解,这是首个在 可实现情形下实现多项式样本复杂度的 CMDP 结果。
引用
@article{arxiv.2406.18529,
title = {Confident Natural Policy Gradient for Local Planning in $q_\pi$-realizable Constrained MDPs},
author = {Tian Tian and Lin F. Yang and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2406.18529},
year = {2024}
}