中文

基于线性函数逼近的高效局部规划

机器学习 2022-02-08 v3 最优化与控制 机器学习

摘要

我们研究具有线性函数逼近和模拟器的查询与计算高效规划算法。我们假设智能体仅具有对模拟器的局部访问权限,即智能体只能在之前访问过的状态处查询模拟器。该设定比许多先前关于带生成模型的强化学习的工作更为实用。针对该设定,我们提出两种算法,称为置信蒙特卡洛最小二乘策略迭代(Confident MC-LSPI)和置信蒙特卡洛Politex(Confident MC-Politex)。在假设所有策略的Q函数关于状态-动作对的已知特征呈线性的前提下,我们证明我们的算法在特征维度、有效规划时界和目标次优性方面具有多项式级的查询与计算代价,而这些代价与状态空间的大小无关。我们工作的一个技术贡献是引入了一种新颖的证明技术,其利用了虚拟策略迭代算法。我们使用该方法借助关于\ell_\infty有界近似策略迭代的已有结果,证明即使仅具有对模拟器的局部访问权限,我们的算法也能学习给定初始状态的最优策略。我们相信该技术可扩展至超出本工作的更广泛设定。

关键词

引用

@article{arxiv.2108.05533,
  title  = {Efficient Local Planning with Linear Function Approximation},
  author = {Dong Yin and Botao Hao and Yasin Abbasi-Yadkori and Nevena Lazić and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2108.05533},
  year   = {2022}
}

备注

Algorithmic Learning Theory 2022