中文

低精度策略蒸馏及其在基于神经形态计算的低功耗实时感知-认知-动作回路中的应用

机器学习 2018-09-26 v1 神经与进化计算 机器学习

摘要

在强化学习(RL)设定中,低精度网络因二值激活在函数逼近上的局限性而相对少有探索。在此,我们在离散动作 ATARI 领域中首次证明,从高精度网络进行低精度策略蒸馏,提供了一种有原则且实用的训练 RL 智能体的方法。作为一个应用,我们在 10 种不同的 ATARI 游戏上,通过将一系列游戏帧转换为离散动作,在低功耗神经形态硬件上实现了实时端到端的游戏运行。

关键词

引用

@article{arxiv.1809.09260,
  title  = {Low Precision Policy Distillation with Application to Low-Power, Real-time Sensation-Cognition-Action Loop with Neuromorphic Computing},
  author = {Jeffrey L Mckinstry and Davis R. Barch and Deepika Bablani and Michael V. Debole and Steven K. Esser and Jeffrey A. Kusnitz and John V. Arthur and Dharmendra S. Modha},
  journal= {arXiv preprint arXiv:1809.09260},
  year   = {2018}
}