基于即插即用求解器的线性混合MDP的近最优无奖励探索
机器学习
2022-03-15 v4
摘要
尽管基于模型的强化学习(RL)方法被认为具有更高的样本效率,但现有算法通常依赖复杂的规划算法与模型学习过程紧密耦合。因此,所学到的模型可能缺乏使用更专门规划器被重用的能力。在本文中,我们解决此问题并提供在无奖励信号指导下高效学习RL模型的方法。具体而言,我们采取即插即用求解器(plug-in solver)方法,在探索阶段聚焦于学习一个模型,并要求在该学习模型上的任何规划算法都能给出近最优策略。特别地,我们聚焦于线性混合MDP设定,其中概率转移矩阵是一组现有模型的(未知)凸组合。我们表明,通过建立一种新颖的探索算法,即插即用方法通过与环境进行次交互学习一个模型,且该模型上的任何-最优规划器在原模型上给出-最优策略。该样本复杂度与非即插即用方法的下界匹配,并且是统计最优的。我们通过利用基于Bernstein不等式和线性混合MDP特有性质的精细最大总方差界实现了这一结果。
引用
@article{arxiv.2110.03244,
title = {Near-Optimal Reward-Free Exploration for Linear Mixture MDPs with Plug-in Solver},
author = {Xiaoyu Chen and Jiachen Hu and Lin F. Yang and Liwei Wang},
journal= {arXiv preprint arXiv:2110.03244},
year = {2022}
}