中文

RAPID-RL:一种带抢占式退出的可重构架构以实现高效深度强化学习

机器学习 2021-09-20 v1

摘要

当今的深度强化学习(RL)系统在构建超越人类水平性能的智能体方面展现出巨大前景。然而,底层深度神经网络(DNN)所带来的计算复杂性导致了高功耗的实现。这使得深度RL系统难以部署在资源受限的边缘设备上。为应对这一挑战,我们提出了一种带抢占式退出的可重构架构以实现高效深度RL(RAPID-RL)。RAPID-RL基于输入难度级别对DNN层进行条件激活。这允许在推理过程中动态调整计算开销,同时保持有竞争力的性能。我们通过为深度Q网络(DQN)增加侧分支来实现这一点,这些侧分支能够生成中间预测及相应的置信度分数。我们还提出了一种新颖的训练方法,用于在动态RL设定中学习动作与分支置信度分数。我们的实验在Atari 2600游戏任务以及开源无人机模拟器(PEDRA)上的真实无人机导航任务上评估了所提框架。我们表明,与无任何侧分支的基线DQN相比,RAPID-RL在Atari(无人机导航)任务上仅产生0.34倍(0.25倍)的操作数(OPS),同时保持0.88倍(0.91倍)以上的性能。OPS的降低带来了快速且高效的推理,证明其对资源受限边缘极为有益,因为在最小计算下快速决策至关重要。

关键词

引用

@article{arxiv.2109.08231,
  title  = {RAPID-RL: A Reconfigurable Architecture with Preemptive-Exits for Efficient Deep-Reinforcement Learning},
  author = {Adarsh Kumar Kosta and Malik Aqeel Anwar and Priyadarshini Panda and Arijit Raychowdhury and Kaushik Roy},
  journal= {arXiv preprint arXiv:2109.08231},
  year   = {2021}
}