中文

一策足矣:单策略并行探索在免奖励强化学习中近最优

机器学习 2023-03-03 v3 机器学习

摘要

尽管并行已在强化学习(RL)中被广泛使用,但并行探索的定量效应在理论上尚未被充分理解。我们研究了在线性马尔可夫决策过程(MDP)和两人零和马尔可夫博弈(MG)中,简单并行探索对免奖励 RL 的益处。与现有聚焦于鼓励智能体探索多样化策略集合的文献不同,我们表明,在所有情形下,使用单一策略引导所有智能体的探索,即足以相比完全串行对应方法获得近线性的加速。此外,我们证明该简单过程在线性 MDP 的免奖励设定下近极小极大最优。从实践角度看,我们的论文表明,在探索阶段引入并行时,单一策略已足够且可被证明近最优。

关键词

引用

@article{arxiv.2205.15891,
  title  = {One Policy is Enough: Parallel Exploration with a Single Policy is Near-Optimal for Reward-Free Reinforcement Learning},
  author = {Pedro Cisneros-Velarde and Boxiang Lyu and Sanmi Koyejo and Mladen Kolar},
  journal= {arXiv preprint arXiv:2205.15891},
  year   = {2023}
}

备注

50 pages