具有线性可实现最优动作值函数的MDP中规划的指数下界
机器学习
2021-02-17 v2 人工智能
机器学习
摘要
我们考虑在固定时域与折扣马尔可夫决策过程(MDPs)中,具有线性函数逼近和生成模型下的局部规划问题,假设最优动作值函数位于规划者可用的特征映射的张成空间中。先前工作留下了一个开放问题:是否存在仅需poly(H,d)次查询(与MDP无关)的可靠规划器,其中H为时域,d为特征维数。我们给出否定回答:我们证明任何可靠规划器在固定时域设定下必须查询至少个样本,在折扣设定下必须查询个样本。我们还证明对于任意,具有次查询的最小二乘值迭代算法可在固定时域设定下计算出-最优策略。我们讨论了其意义与遗留的开放问题。
引用
@article{arxiv.2010.01374,
title = {Exponential Lower Bounds for Planning in MDPs With Linearly-Realizable Optimal Action-Value Functions},
author = {Gellért Weisz and Philip Amortila and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2010.01374},
year = {2021}
}