MEPG:一种用于深度强化学习的极简集成策略梯度框架
机器学习
2022-07-12 v2 人工智能
摘要
在强化学习(RL)智能体训练过程中,由于智能体的行为随时间变化,训练数据的分布是非平稳的。因此,存在智能体过度特化到特定分布而在整体上性能受损的风险。集成RL可通过学习鲁棒策略来缓解此问题。然而,由于新引入的价值与策略函数,它面临巨大的计算资源消耗问题。本文为避免这一臭名昭著的资源消耗问题,设计了一种新颖且简单的集成深度RL框架,将多个模型整合为单一模型。具体而言,我们提出极简集成策略梯度框架(MEPG),其利用改进的dropout算子引入极简集成一致的Bellman更新。MEPG通过保持Bellman方程两侧的dropout一致性而具备集成特性。此外,dropout算子也增强了MEPG的泛化能力。而且,我们从理论上证明MEPG中的策略评估阶段维持两个同步的深度高斯过程。为验证MEPG框架的泛化能力,我们在gym模拟器上开展实验,结果表明MEPG框架在不增加额外计算资源成本的情况下,性能优于或达到当前最先进的集成方法与无模型方法的相似水平。
引用
@article{arxiv.2109.10552,
title = {MEPG: A Minimalist Ensemble Policy Gradient Framework for Deep Reinforcement Learning},
author = {Qiang He and Huangyuan Su and Chen Gong and Xinwen Hou},
journal= {arXiv preprint arXiv:2109.10552},
year = {2022}
}
备注
19 pages, 7 figures