中文

在零样本强化学习中通过探索实现泛化

机器学习 2024-01-17 v3

摘要

我们研究强化学习中的零样本泛化——在一组训练任务上优化策略,以在相似但未见过的测试任务上表现良好。为缓解过拟合,先前工作探索了任务不变性的不同概念。然而,在诸如 ProcGen Maze 等问题上,不存在对任务可视化具有不变性的充分解,因此基于不变性的方法会失败。我们的洞见是,学习一个能有效探索\textit{探索}领域的策略比最大化特定任务奖励的策略更难被记忆,因此我们期望这种学习到的行为能良好泛化;我们确实在多个对基于不变性的方法而言困难的任务上从经验上证明了这一点。我们的探索以泛化\textit{探索以泛化}(Explore to Generalize,ExpGen)算法基于该洞见构建:我们训练一个额外的智能体集成来优化奖励。在测试时,要么集成对某个动作达成一致,此时我们泛化良好;要么我们采取探索性动作,这些动作泛化良好并将我们驱动到状态空间的新颖部分,在那里集成可能再次达成一致。我们表明,我们的方法在迄今难以有效泛化的 ProcGen 挑战任务上达到了最先进水平,在 Maze 任务上以200200个训练关卡取得了83%83\%的成功率,在 Heist 上取得了74%74\%。ExpGen 也可与基于不变性的方法结合以兼得两者优势,在 ProcGen 上刷新了最先进结果。

关键词

引用

@article{arxiv.2306.03072,
  title  = {Explore to Generalize in Zero-Shot RL},
  author = {Ev Zisselman and Itai Lavie and Daniel Soudry and Aviv Tamar},
  journal= {arXiv preprint arXiv:2306.03072},
  year   = {2024}
}