中文

自适应多目标探索

机器学习 2022-02-25 v2

摘要

我们提出了一种可证明高效的多目标探索的通用策略。它依赖于 AdaGoal,一种新颖的目标选择方案,该方案利用到达状态的不确定性度量来自适应地瞄准既不太难也不太易的目标。我们展示了如何将 AdaGoal 用于实现学习目标:在奖励自由的马尔可夫决策过程中,从参考状态 s0s_0 出发在期望步数 LL 内可达的(初始未知)目标状态集合上学习一个 ϵ\epsilon-最优的目标条件策略。在具有 SS 个状态和 AA 个动作的表格情形下,我们的算法需要 O~(L3SAϵ2)\tilde{O}(L^3 S A \epsilon^{-2}) 步探索,这近乎是极小极大最优的。我们还在线性混合马尔可夫决策过程中直接实例化 AdaGoal,得到了首个具有线性函数逼近的面向目标的 PAC 保证。除其坚实的理论保证外,我们通过将其选择“不确定”目标的思想与最大化价值集成分歧相联系,在概念和经验上都将 AdaGoal 锚定于目标条件深度强化学习中。

关键词

引用

@article{arxiv.2111.12045,
  title  = {Adaptive Multi-Goal Exploration},
  author = {Jean Tarbouriech and Omar Darwiche Domingues and Pierre Ménard and Matteo Pirotta and Michal Valko and Alessandro Lazaric},
  journal= {arXiv preprint arXiv:2111.12045},
  year   = {2022}
}

备注

AISTATS 2022