中文

DRED:通过数据正则化环境设计实现强化学习的零样本迁移

机器学习 2024-06-17 v4 人工智能

摘要

使用深度强化学习(RL)训练的自主智能体通常缺乏成功泛化到新环境的能力,即使这些环境与它们在训练期间遇到的环境具有共同特征。在这项工作中,我们研究了单个环境实例或关卡的采样如何影响RL智能体的零样本泛化(ZSG)能力。我们发现,对于共享其基础层的深度Actor-Critic架构,根据其值损失优先排序关卡可以最小化智能体内部表示与生成训练数据中训练关卡集之间的互信息。这为某些自适应采样策略所实现的正则化提供了新的理论依据。然后,我们将注意力转向无监督环境设计(UED)方法,这些方法假设对关卡生成具有控制权。我们发现,现有的UED方法可以显著改变训练分布,这转化为较低的ZSG性能。为了防止过拟合和分布偏移,我们引入了数据正则化环境设计(DRED)。DRED使用一个生成模型来生成关卡,该模型经过训练以近似初始关卡参数集的地面真实分布。通过其根基,DRED在ZSG方面比自适应关卡采样策略和UED方法取得了显著改进。我们的代码和实验数据可在https://github.com/uoe-agents/dred获取。

关键词

引用

@article{arxiv.2402.03479,
  title  = {DRED: Zero-Shot Transfer in Reinforcement Learning via Data-Regularised Environment Design},
  author = {Samuel Garcin and James Doran and Shangmin Guo and Christopher G. Lucas and Stefano V. Albrecht},
  journal= {arXiv preprint arXiv:2402.03479},
  year   = {2024}
}

备注

To appear in ICML 2024. A preliminary version of this work (arXiv:2310.03494) was presented at the ALOE workshop, NeurIPS 2023. arXiv admin note: text overlap with arXiv:2310.03494