基于线性函数逼近的高效局部规划
机器学习
2022-02-08 v3 最优化与控制
机器学习
摘要
我们研究具有线性函数逼近和模拟器的查询与计算高效规划算法。我们假设智能体仅具有对模拟器的局部访问权限,即智能体只能在之前访问过的状态处查询模拟器。该设定比许多先前关于带生成模型的强化学习的工作更为实用。针对该设定,我们提出两种算法,称为置信蒙特卡洛最小二乘策略迭代(Confident MC-LSPI)和置信蒙特卡洛Politex(Confident MC-Politex)。在假设所有策略的Q函数关于状态-动作对的已知特征呈线性的前提下,我们证明我们的算法在特征维度、有效规划时界和目标次优性方面具有多项式级的查询与计算代价,而这些代价与状态空间的大小无关。我们工作的一个技术贡献是引入了一种新颖的证明技术,其利用了虚拟策略迭代算法。我们使用该方法借助关于有界近似策略迭代的已有结果,证明即使仅具有对模拟器的局部访问权限,我们的算法也能学习给定初始状态的最优策略。我们相信该技术可扩展至超出本工作的更广泛设定。
引用
@article{arxiv.2108.05533,
title = {Efficient Local Planning with Linear Function Approximation},
author = {Dong Yin and Botao Hao and Yasin Abbasi-Yadkori and Nevena Lazić and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2108.05533},
year = {2022}
}
备注
Algorithmic Learning Theory 2022