中文

具有线性可实现最优动作值函数的MDP中规划的指数下界

机器学习 2021-02-17 v2 人工智能 机器学习

摘要

我们考虑在固定时域与折扣马尔可夫决策过程(MDPs)中,具有线性函数逼近和生成模型下的局部规划问题,假设最优动作值函数位于规划者可用的特征映射的张成空间中。先前工作留下了一个开放问题:是否存在仅需poly(H,d)次查询(与MDP无关)的可靠规划器,其中H为时域,d为特征维数。我们给出否定回答:我们证明任何可靠规划器在固定时域设定下必须查询至少min(exp(Ω(d)),Ω(2H))\min(\exp({\Omega}(d)), {\Omega}(2^H))个样本,在折扣设定下必须查询exp(Ω(d))\exp({\Omega}(d))个样本。我们还证明对于任意δ>0{\delta}>0,具有O(H5dH+1/δ2)O(H^5d^{H+1}/{\delta}^2)次查询的最小二乘值迭代算法可在固定时域设定下计算出δ{\delta}-最优策略。我们讨论了其意义与遗留的开放问题。

关键词

引用

@article{arxiv.2010.01374,
  title  = {Exponential Lower Bounds for Planning in MDPs With Linearly-Realizable Optimal Action-Value Functions},
  author = {Gellért Weisz and Philip Amortila and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2010.01374},
  year   = {2021}
}