MDP中增量式自主探索的改进样本复杂度
机器学习
2021-01-01 v1 机器学习
摘要
我们研究在无可提供奖励函数时对未知环境的探索。基于Lim和Auer[1]引入的增量探索设定,我们定义学习目标为:学习从参考状态s_0出发在L步内(期望意义上)增量可达的所有状态的ε-最优目标条件策略集合。本文中,我们引入一种新颖的基于模型的方法,其交错执行从s_0发现新状态与改进模型估计精度,该估计用于计算到达新发现状态的目标条件策略。所得算法DisCo实现了随样本复杂度缩放为Õ(L^5 S_{L+ε} Γ_{L+ε} A ε^{-2}),其中A为动作数,S_{L+ε}为从s_0在L+ε步内增量可达的状态数,Γ_{L+ε}为这些状态上动力学的分支因子。这相对于[1]中算法在ε和L上均有改进,代价是额外的Γ_{L+ε}因子,而在大多数相关环境中该因子较小。此外,DisCo是首个可返回在最小代价c_min的L-可达状态上定义的任何代价敏感最短路径问题的ε/c_min-最优策略的算法。最后,我们报告了证实理论发现的初步实证结果。
引用
@article{arxiv.2012.14755,
title = {Improved Sample Complexity for Incremental Autonomous Exploration in MDPs},
author = {Jean Tarbouriech and Matteo Pirotta and Michal Valko and Alessandro Lazaric},
journal= {arXiv preprint arXiv:2012.14755},
year = {2021}
}
备注
NeurIPS 2020