中文

面向 PAC 强化学习的主动覆盖

机器学习 2023-06-26 v1

摘要

收集并利用具有良好覆盖性质的数据在强化学习(RL)的不同方面起着关键作用,包括无奖励探索与离线学习。然而,“良好覆盖”的概念实际上取决于具体的应用场景,因为适用于某一情境的数据未必适用于另一情境。本文中,我们形式化了情节式马尔可夫决策过程(MDP)中的主动覆盖问题,其目标是通过与环境交互以满足给定的采样要求。该框架具有充分的灵活性以指定任意期望的覆盖性质,从而可应用于任何涉及在线探索的问题。我们的主要贡献是关于主动覆盖样本复杂度的实例相关下界,以及一个简单博弈论算法 CovGame,其性能几乎达到该下界。我们随后表明,CovGame 可用作构建模块来解决不同的 PAC RL 任务。特别地,我们得到了一个用于 PAC 无奖励探索的简单算法,其实例相关样本复杂度在某些“易于探索”的 MDP 中低于极小极大复杂度。通过将该探索算法与一种在策略空间中进行隐式消去的新技术进一步结合,我们获得了一个计算高效的最优策略辨识算法,其实例相关样本复杂度随策略值之间的间隙而缩放。

关键词

引用

@article{arxiv.2306.13601,
  title  = {Active Coverage for PAC Reinforcement Learning},
  author = {Aymen Al-Marjani and Andrea Tirinzoni and Emilie Kaufmann},
  journal= {arXiv preprint arXiv:2306.13601},
  year   = {2023}
}

备注

Accepted at COLT 2023