中文

DEFT:用于强化学习中快速迁移的多样性集成方法

机器学习 2022-09-27 v1 人工智能

摘要

深度集成已被证明将典型集成学习中的积极效果扩展到神经网络与强化学习(RL)。然而,在提升此类集成模型效率方面仍有许多工作可做。本工作中,我们提出用于 RL 中快速迁移的多样性集成(DEFT),一种基于集成的新方法,用于高度多模态环境中的强化学习并改善向未见环境的迁移。算法分为两个主要阶段:集成成员的训练,以及将集成成员合成(或微调)为在新环境中工作的策略。算法第一阶段涉及并行训练常规策略梯度或 actor-critic 智能体,但在损失中增加一项以鼓励这些策略彼此不同。这使得单个单模态智能体探索最优策略空间并比单一 actor 捕获环境中更多的多模态性。DEFT 第二阶段涉及以两种方式之一将组件策略合成为在修正环境中表现良好的新策略。为评估 DEFT 性能,我们从 Proximal Policy Optimization (PPO) 算法的基础版本出发,以 DEFT 的修改对其进行扩展。我们的结果表明预训练阶段能有效在多模态环境中产生多样性策略。DEFT 常比替代方案(如不含 DEFT 的随机初始化及集成成员微调)显著更快地收敛到高奖励。尽管当然还需更多工作从理论上分析 DEFT 并扩展使其更鲁棒,我们认为它提供了一个在仍使用简单策略表示的 RL 方法时捕获环境多模态性的强框架。

关键词

引用

@article{arxiv.2209.12412,
  title  = {DEFT: Diverse Ensembles for Fast Transfer in Reinforcement Learning},
  author = {Simeon Adebola and Satvik Sharma and Kaushik Shivakumar},
  journal= {arXiv preprint arXiv:2209.12412},
  year   = {2022}
}