面向异构平台深度强化学习的软硬件协同优化工具包
分布式、并行与集群计算
2023-11-17 v1
摘要
深度强化学习(DRL)在各种 AI 应用中至关重要。DRL 算法包含多样的计算内核,使用同构架构可能无法同时优化。然而,即便具备可用的异构架构,由于现代数据中心所采用硬件与编程模型的复杂性,优化 DRL 性能仍具挑战。为此,我们引入 PEARL,一个用于在由通用处理器(CPU)与加速器(GPU、FPGA)组成的异构平台上组合并行 DRL 系统的工具包。我们的创新包括:1. 一种底层硬件无关的通用训练协议,支持跨多种处理器与加速器的可移植实现。2. 在协议中融入 DRL 特定的调度优化,促进并行化训练并提升整体系统性能。3. 用于使用该工具包高效开发的高层 API。4. 通过性能估计自动优化 DRL 任务到设备的分配,支持包括吞吐量与功耗效率在内的多种优化指标。我们通过在两个不同的异构平台上使用两种广泛使用的 DRL 算法 DQN 和 DDPG 进行实验来展示我们的工具包。所生成的实现在吞吐量上相较 CPU-GPU 平台的 SOTA 库提升高达 2.1,在功耗效率上提升高达 3.4。
引用
@article{arxiv.2311.09445,
title = {A Software-Hardware Co-Optimized Toolkit for Deep Reinforcement Learning on Heterogeneous Platforms},
author = {Yuan Meng and Michael Kinsner and Deshanand Singh and Mahesh A Iyer and Viktor Prasanna},
journal= {arXiv preprint arXiv:2311.09445},
year = {2023}
}
备注
Submitted to IPDPS 2024