中文

用于增量自主探索的分层状态发现

机器学习 2023-02-09 v1

摘要

我们研究由 Lim & Auer (2012) 提出的自主探索(AX)问题。在该设定中,目标是发现一组 ϵ\epsilon-最优策略,到达一组 SL\mathcal{S}_L^{\rightarrow} 中增量 LL-可控状态。我们引入了一种基于状态扩展算子的迭代应用的增量 LL-可控状态集合的新分层分解。我们利用这些结果设计了 Layered Autonomous Exploration (LAE),一种达到样本复杂度 O~(LSL(1+ϵ)ΓL(1+ϵ)Aln12(SL(1+ϵ))/ϵ2)\tilde{\mathcal{O}}(LS^{\rightarrow}_{L(1+\epsilon)}\Gamma_{L(1+\epsilon)} A \ln^{12}(S^{\rightarrow}_{L(1+\epsilon)})/\epsilon^2) 的 AX 新算法,其中 SL(1+ϵ)S^{\rightarrow}_{L(1+\epsilon)} 为增量 L(1+ϵ)L(1+\epsilon)-可控状态数,AA 为动作数,ΓL(1+ϵ)\Gamma_{L(1+\epsilon)} 为这些状态上转移的 branching factor。LAE 相较 Tarbouriech 等人 (2020a) 的算法提升了 L2L^2 倍,且是首个在可数无限状态空间中工作的 AX 算法。此外,我们表明在某一可辨识性假设下,LAE 实现了 O~(LSLAln12(SL)/ϵ2)\tilde{\mathcal{O}}(LS^{\rightarrow}_{L}A\ln^{12}(S^{\rightarrow}_{L})/\epsilon^2) 的极小极大最优样本复杂度,优于现有算法,并首次在对数因子内匹配 Cai 等人 (2022) 证明的下界。

关键词

引用

@article{arxiv.2302.03789,
  title  = {Layered State Discovery for Incremental Autonomous Exploration},
  author = {Liyu Chen and Andrea Tirinzoni and Alessandro Lazaric and Matteo Pirotta},
  journal= {arXiv preprint arXiv:2302.03789},
  year   = {2023}
}