中文

利用离线数据加速程序生成环境中的强化学习

机器学习 2024-12-10 v2 人工智能

摘要

强化学习(RL)的关键挑战之一是智能体将其所学策略泛化到未见设置的能力。此外,训练 RL 智能体需要与环境进行大量交互。受离线 RL 与模仿学习(IL)近期成功的启发,我们开展一项研究,考察智能体能否以轨迹形式的离线数据来提升程序生成环境中的样本效率。我们考虑将离线数据用于 RL 的两种 IL 设置:(1) 在线 RL 训练前预训练策略;(2) 在线 RL 与来自离线数据的 IL 同时训练策略。我们分析了可用离线轨迹的质量(轨迹最优性)与多样性(轨迹数量与覆盖关卡)对两种方法有效性的影响。在 MiniGrid 环境中四个著名的稀疏奖励任务上,我们发现用于预训练的 IL 以及在线 RL 训练期间同时进行的 IL 均能一致地改善样本效率,并收敛到最优策略。此外,我们表明仅用两条轨迹预训练策略,就足以决定在线训练结束时是学到最优策略还是完全学不到。我们的发现激励人们在有离线轨迹可用或可生成时,于程序生成环境中广泛采用 IL 预训练与并行 IL。

关键词

引用

@article{arxiv.2304.09825,
  title  = {Using Offline Data to Speed Up Reinforcement Learning in Procedurally Generated Environments},
  author = {Alain Andres and Lukas Schäfer and Stefano V. Albrecht and Javier Del Ser},
  journal= {arXiv preprint arXiv:2304.09825},
  year   = {2024}
}

备注

Initially presented at the Adaptive and Learning Agents Workshop (ALA) at the AAMAS conference 2023; the current extended version was accepted at Neurocomputing journal