中文

最优状态值函数线性可实现条件下 MDP 中查询高效的规划

机器学习 2021-07-12 v3 人工智能 机器学习

摘要

我们考虑在生成模型下、固定时域 MDP 中的局部规划,假设最优值函数接近某个特征映射的张成空间。生成模型提供对 MDP 的局部访问:规划器可以针对先前返回的状态和任意动作请求随机转移,且特征仅在此过程中遇到的状态上可访问。与先前工作(例如 Lattimore 等人 (2020))假设所有策略均线性可实现不同,我们考虑显著放宽后的假设,即仅存在一个线性可实现的(确定性)策略。Weisz 等人 (2020) 近期给出的下界表明,当最优策略的动作值函数线性可实现时,相关问题需要指数级数量的查询,或在 HH(MDP 的时域)或在 dd(特征映射的维度)上。他们的构造关键依赖于具有指数级大的动作集。相反,在本工作中,我们证明只要动作集大小为常量,状态值函数可现实性下 poly(H,d)(H,d) 规划是可能的。具体而言,我们提出 TensorPlan 算法,该算法使用 poly((dH/δ)A)((dH/\delta)^A) 次模拟器查询,以找到相对于任意确定性策略的 δ\delta-最优策略,该策略的值函数以某有界参数线性可实现。这是首个仅利用单一竞争值函数的线性可实现性便给出多项式查询复杂度保证的算法。计算代价是否同样有界仍是一个开放问题。我们将上界推广到近可实现情形以及无限时域折扣设定。我们还给出了无限时域片段式设定下的一个下界:达到常数次优性的规划器需要指数级多的查询,或在 dd 或在动作数量上。

关键词

引用

@article{arxiv.2102.02049,
  title  = {On Query-efficient Planning in MDPs under Linear Realizability of the Optimal State-value Function},
  author = {Gellért Weisz and Philip Amortila and Barnabás Janzer and Yasin Abbasi-Yadkori and Nan Jiang and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2102.02049},
  year   = {2021}
}