代理经验回放:面向分布式强化学习的联邦蒸馏
机器学习
2020-05-18 v2 人工智能
摘要
传统分布式深度强化学习(RL)通常依赖交换各智能体的经验回放记忆(RM)。由于 RM 包含全部状态观测与动作策略历史,其可能带来巨大通信开销并侵犯各智能体隐私。作为替代,本文提出一种通信高效且保护隐私的分布式 RL 框架,称为联邦强化蒸馏(FRD)。在 FRD 中,各智能体交换其代理经验回放记忆(ProxRM),其中策略相对于聚类实际状态的代理状态进行局部平均。为提供 FRD 设计见解,我们给出了关于 ProxRM 结构、神经网络架构与通信间隔影响的消融研究。此外,我们提出 FRD 的改进版本,称为 mixup 增强 FRD(MixFRD),其中 ProxRM 使用 mixup 数据增强算法进行插值。在 Cartpole 环境中的仿真验证了 MixFRD 相较于基准方案、原始 FRD、联邦强化学习(FRL)与策略蒸馏(PD)在降低任务完成时间方差与通信成本方面的有效性。
引用
@article{arxiv.2005.06105,
title = {Proxy Experience Replay: Federated Distillation for Distributed Reinforcement Learning},
author = {Han Cha and Jihong Park and Hyesung Kim and Mehdi Bennis and Seong-Lyun Kim},
journal= {arXiv preprint arXiv:2005.06105},
year = {2020}
}
备注
8 pages, 5 figures, This paper is accepted to IEEE Intelligent Systems special issue of July/Aug 2020 - Federated Machine Learning