一策足矣:单策略并行探索在免奖励强化学习中近最优
机器学习
2023-03-03 v3 机器学习
摘要
尽管并行已在强化学习(RL)中被广泛使用,但并行探索的定量效应在理论上尚未被充分理解。我们研究了在线性马尔可夫决策过程(MDP)和两人零和马尔可夫博弈(MG)中,简单并行探索对免奖励 RL 的益处。与现有聚焦于鼓励智能体探索多样化策略集合的文献不同,我们表明,在所有情形下,使用单一策略引导所有智能体的探索,即足以相比完全串行对应方法获得近线性的加速。此外,我们证明该简单过程在线性 MDP 的免奖励设定下近极小极大最优。从实践角度看,我们的论文表明,在探索阶段引入并行时,单一策略已足够且可被证明近最优。
引用
@article{arxiv.2205.15891,
title = {One Policy is Enough: Parallel Exploration with a Single Policy is Near-Optimal for Reward-Free Reinforcement Learning},
author = {Pedro Cisneros-Velarde and Boxiang Lyu and Sanmi Koyejo and Mladen Kolar},
journal= {arXiv preprint arXiv:2205.15891},
year = {2023}
}
备注
50 pages