基于代理经验记忆的联邦强化蒸馏
机器学习
2020-04-14 v2 多智能体系统
网络与互联网体系结构
机器学习
摘要
在分布式强化学习中,交换每个智能体的经验记忆从而集体训练其本地模型是常见做法。然而,经验记忆包含了宿主智能体所有先前的状态观测及其对应策略,这可能侵犯智能体的隐私。为避免该问题,本工作中我们提出一种保护隐私的分布式强化学习(RL)框架,称为联邦强化蒸馏(FRD)。其核心思想是交换一个由预先安排的状态集合与时间平均策略组成的代理经验记忆,从而保护实际经验的隐私。基于优势 actor-critic 强化学习架构,我们从数值上评估了 FRD 的有效性,并研究了 FRD 的性能如何受代理记忆结构及不同记忆交换规则的影响。
引用
@article{arxiv.1907.06536,
title = {Federated Reinforcement Distillation with Proxy Experience Memory},
author = {Han Cha and Jihong Park and Hyesung Kim and Seong-Lyun Kim and Mehdi Bennis},
journal= {arXiv preprint arXiv:1907.06536},
year = {2020}
}
备注
To be presented at the 28th International Joint Conference on Artificial Intelligence (IJCAI-19), 1st International Workshop on Federated Machine Learning for User Privacy and Data Confidentiality (FML'19), Macao, China