TensorPlan 及最优值函数线性可实现下 MDP 规划的动作数较少下界
机器学习
2022-03-11 v2 人工智能
机器学习
摘要
我们考虑在具有线性函数逼近的固定时域马尔可夫决策过程(MDPs)中,带有生成模型的在线规划的极小极大查询复杂度。遵循近期工作,我们考虑以下几类广泛问题:其中(i)最优值函数 或(ii)最优动作值函数 位于某些特征的线性张成空间中;或(iii)当限制于从起始状态可达的状态时, 和 均位于线性张成空间中。最近,Weisz 等人(2021b)表明,在(ii)下,当动作集大小 可取为 的指数级时,任何规划算法的极小极大查询复杂度至少是关于时域 或特征维度 的指数级。另一方面,对于设定(i),Weisz 等人(2021a)引入了 TensorPlan,一种在动作数固定时其查询代价在所有相关量上均为多项式的规划器。除其他外,这两项工作留下了一个开放问题:当 为 的次指数级时,是否可能具有多项式查询复杂度。在本文中,我们以否定方式回答了该问题:我们证明在(i)、(ii)或(iii)下,当 时,指数级大的下界成立。特别地,这相较于 Du 等人(2021)在(iii)对所有状态成立时证明多项式上界的工作,意味着一种或许令人惊讶的查询复杂度指数级分离。此外,我们展示了 TensorPlan 的上界可扩展至在(iii)下成立,并且对于具有确定性转移和随机奖励的 MDPs,在(ii)下也成立。
引用
@article{arxiv.2110.02195,
title = {TensorPlan and the Few Actions Lower Bound for Planning in MDPs under Linear Realizability of Optimal Value Functions},
author = {Gellért Weisz and Csaba Szepesvári and András György},
journal= {arXiv preprint arXiv:2110.02195},
year = {2022}
}