在 $q^\pi$-可实现 MDP 中用于高效局部规划的置信近似策略迭代
机器学习
2022-10-31 v1 人工智能
机器学习
摘要
我们考虑 -折扣马尔可夫决策过程中的近似动态规划,并将其应用于带有线性值函数近似的近似规划。我们的第一个贡献是近似策略迭代 (API) 的一种新变体,称为置信近似策略迭代 (CAPI),它计算一个确定性平稳策略,其最优误差界随有效时域 与平稳策略动作值函数的最坏情况近似误差 的乘积线性缩放。相对于 API(其误差随 缩放)的这一改进,代价是内存成本增加 倍。与 Scherrer 和 Lesner [2012] 建议计算非平稳策略以实现类似改进(具有相同内存开销)不同,我们能够坚持使用平稳策略。这允许我们的第二个贡献,即将 CAPI 应用于具有模拟器局部访问和 维线性函数近似的规划。据此,我们设计了一种规划算法,该算法应用 CAPI 在动态演化的状态集上获得一系列精度逐步精炼的策略。该算法在向模拟器发出 次查询后输出一个 -最优策略,同时达到最优精度界和已知最佳查询复杂度界,而文献中较早的算法仅能达到其中之一。除 外,该查询复杂度在所有参数上均被证明是紧的。这些改进以算法及其输出策略的内存和计算成本轻度(多项式级)增加为代价。
引用
@article{arxiv.2210.15755,
title = {Confident Approximate Policy Iteration for Efficient Local Planning in $q^\pi$-realizable MDPs},
author = {Gellért Weisz and András György and Tadashi Kozuno and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2210.15755},
year = {2022}
}