通过网内经验采样加速分布式深度强化学习
分布式、并行与集群计算
2023-03-13 v3 机器学习
摘要
互连多个计算节点的计算集群被用于加速基于 DQN(Deep Q-Network,深度 Q 网络)的分布式强化学习。在分布式强化学习中,Actor 节点通过与给定环境交互获取经验,Learner 节点优化其 DQN 模型。由于 Actor 与 Learner 节点间的数据传输随 Actor 节点数量及其经验大小而增加,它们之间的通信开销是主要性能瓶颈之一。本文将二者间的通信通过基于 DPDK 的网络优化加速,并在通过 40GbE(40Gbit 以太网)网络互连的 Actor 与 Learner 节点之间部署基于 DPDK 的低延迟经验回放内存服务器。评估结果表明,作为一种网络优化技术,DPDK 的内核旁路将访问共享内存服务器的网络延迟降低了 32.7% 至 58.9%。作为另一种网络优化技术,Actor 与 Learner 节点间的网内经验回放内存服务器将访问经验回放内存的延迟降低了 11.7% 至 28.1%,并将优先经验采样的通信延迟降低了 21.9% 至 29.1%。
引用
@article{arxiv.2110.13506,
title = {Accelerating Distributed Deep Reinforcement Learning by In-Network Experience Sampling},
author = {Masaki Furukawa and Hiroki Matsutani},
journal= {arXiv preprint arXiv:2110.13506},
year = {2023}
}
备注
PDP'22