策略梯度方法的强多项式时间性质与验证分析
计算机视觉与模式识别
2024-10-01 v1
摘要
本文提出了一种新型终止准则,称为优势间隙函数(advantage gap function),用于有限状态和动作的马尔可夫决策过程(MDP)和强化学习(RL)。通过将该优势间隙函数纳入步长规则设计中,并推导出独立于最优策略的稳态分布的新型线性收敛率,我们证明了策略梯度方法可以以强多项式时间求解 MDP。据我们了解,这是首次确立此类强收敛性质。此外,在随机情形下,即仅获得策略梯度的随机估计时,我们证明了优势间隙函数为每个状态的优度间隙提供近似值,并且在每个状态上 exhibits 次线性收敛率。优势间隙函数在随机情形下易于估计,当结合可轻易计算的策略价值上界时,为验证由策略梯度方法生成的解提供了便捷方式。因此,我们的发展为 RL 提供了原则性且可计算的优度度量,而当前做法往往依赖于算法间或基准测试的比较,无法给出优度认证。
引用
@article{arxiv.2409.19436,
title = {Introducing SDICE: An Index for Assessing Diversity of Synthetic Medical Datasets},
author = {Mohammed Talha Alam and Raza Imam and Mohammad Areeb Qazi and Asim Ukaye and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2409.19436},
year = {2024}
}
备注
Accepted at BMVC 2024 - PFATCV