中文

面向深度强化学习的大批量仿真

机器学习 2021-03-15 v1 人工智能 计算机视觉与模式识别 图形学

摘要

我们通过比先前工作快两个数量级的速度,在视觉复杂的 3D 环境中加速基于深度强化学习的训练,在单个 GPU 上实现每秒超过 19,000 帧经验的端到端训练速度,在单个八 GPU 机器上高达每秒 72,000 帧。我们方法的核心思想是围绕“批量仿真”原则设计 3D 渲染器和具身导航模拟器:同时接受并执行大批量请求。除了一次性暴露大量工作外,批量仿真允许实现在许多仿真请求之间分摊场景资产的内存存储、渲染工作、数据加载和同步成本,从而显著提高每个 GPU 的仿真智能体数量和整体仿真吞吐量。为了平衡 DNN 推理和训练成本与更快的仿真,我们还构建了一个计算高效的策略 DNN,保持高任务性能,并修改训练算法以在使用大 mini-batch 训练时保持样本效率。通过结合批量仿真和 DNN 性能优化,我们证明了 PointGoal 导航智能体可以在单个 GPU 上于 1.5 天内,在复杂 3D 环境中训练到先前最先进系统使用 64-GPU 集群三天所训练智能体 97% 的精度。我们提供批量 3D 渲染器和模拟器的开源参考实现,以促进将这些想法纳入 RL 系统。

关键词

引用

@article{arxiv.2103.07013,
  title  = {Large Batch Simulation for Deep Reinforcement Learning},
  author = {Brennan Shacklett and Erik Wijmans and Aleksei Petrenko and Manolis Savva and Dhruv Batra and Vladlen Koltun and Kayvon Fatahalian},
  journal= {arXiv preprint arXiv:2103.07013},
  year   = {2021}
}

备注

Published as a conference paper at ICLR 2021