中文

自主探索与多目标随机最短路径的近最优算法

机器学习 2022-05-24 v1

摘要

我们重新审视由 Lim & Auer (2012) 提出的增量自主探索问题。在该设定中,智能体旨在学习一组近最优的目标条件策略,以到达 LL-可控状态:即从初始状态 s0s_0 出发在期望意义上 LL 步内可增量到达的状态。我们引入了一种新的算法,其样本复杂度界强于现有算法。此外,我们还证明了自主探索问题的首个下界。特别地,该下界意味着当 LL-可控状态的数量相对于 LL 多项式增长时,我们提出的算法 Value-Aware Autonomous Exploration 是近乎极小极大最优的。我们算法设计的关键在于建立了自主探索与多目标随机最短路径之间的联系,后者是一个自然推广经典随机最短路径问题的新问题。这一新问题及其与自主探索的联系本身可能具有独立意义。

关键词

引用

@article{arxiv.2205.10729,
  title  = {Near-Optimal Algorithms for Autonomous Exploration and Multi-Goal Stochastic Shortest Path},
  author = {Haoyuan Cai and Tengyu Ma and Simon Du},
  journal= {arXiv preprint arXiv:2205.10729},
  year   = {2022}
}

备注

ICML 2022