中文

RL-Scope:面向深度强化学习负载的跨栈性能剖析

机器学习 2021-03-05 v2 软件工程

摘要

深度强化学习(RL)已在机器人、数据中心管理及其他应用中取得突破性进展。遗憾的是,RL 负载中的系统级瓶颈鲜为人知;我们观察到 RL 负载在结构上存在根本差异,使其天生比监督学习(SL)更不易受 GPU 限制。为解释 RL 负载的训练时间消耗在何处,我们提出 RL-Scope,一种跨栈剖析器,将底层 CPU/GPU 资源使用映射到高层算法操作,并通过校正剖析开销提供准确洞察。利用 RL-Scope,我们调查了 RL 负载的主要维度,包括 ML 后端、RL 算法和模拟器。对于 ML 后端,我们解释了等效 PyTorch 与 TensorFlow 算法实现间 2.3×2.3\times 的运行时差异,并定位到根源于过度抽象算法实现的瓶颈。对于 RL 算法与模拟器,我们表明同策略算法比异策略算法至少多 3.5×3.5\times 的模拟限制。最后,我们剖析了一个扩展负载并证明常用工具报告的 GPU 利用率指标严重夸大 GPU 使用,而 RL-Scope 报告真实的 GPU 受限时间。RL-Scope 是开源工具,可在 https://github.com/UofT-EcoSystem/rlscope 获取。

关键词

引用

@article{arxiv.2102.04285,
  title  = {RL-Scope: Cross-Stack Profiling for Deep Reinforcement Learning Workloads},
  author = {James Gleeson and Srivatsan Krishnan and Moshe Gabel and Vijay Janapa Reddi and Eyal de Lara and Gennady Pekhimenko},
  journal= {arXiv preprint arXiv:2102.04285},
  year   = {2021}
}

备注

RL-Scope is an open-source tool available at https://github.com/UofT-EcoSystem/rlscope . Proceedings of the 4th MLSys Conference, 2021. Changes: camera ready for MLSys publication -- shorten abstract, add acknowledgements, minor grammar fixes