中文

从像素到策略:用于游戏内与跨游戏强化学习的 DQN 编码器

机器学习 2023-08-02 v1 人工智能 机器人学

摘要

强化学习可应用于各种任务与环境。其中许多环境具有相似的共享结构,可利用该结构提升在其他任务上的强化学习性能。迁移学习可利用这一共享结构,通过学习可在不同任务与环境间迁移的策略,从而在广泛任务上实现更高效的学习与更优的性能。本工作探索并比较了从零训练的强化学习模型与不同迁移学习方法之间的性能。此外,本研究探索了在多个游戏环境中训练的模型之性能,旨在开发通用游戏智能体,并利用 DQN 预训练编码器进行迁移学习,在相同游戏或不同游戏上训练。我们的 DQN 模型在仅 20k 回合时即达到 46.16 的平均回合奖励,甚至超越人类水平,且远少于 DeepMind 的 1M 回合。在 Assault 与 Space Invader 环境中分别取得 533.42 与 402.17 的平均奖励,在这些具挑战性环境中表现突出。

关键词

引用

@article{arxiv.2308.00318,
  title  = {Pixel to policy: DQN Encoders for within & cross-game reinforcement learning},
  author = {Ashrya Agrawal and Priyanshi Shah and Sourabh Prakash},
  journal= {arXiv preprint arXiv:2308.00318},
  year   = {2023}
}