低精度策略蒸馏及其在基于神经形态计算的低功耗实时感知-认知-动作回路中的应用
机器学习
2018-09-26 v1 神经与进化计算
机器学习
摘要
在强化学习(RL)设定中,低精度网络因二值激活在函数逼近上的局限性而相对少有探索。在此,我们在离散动作 ATARI 领域中首次证明,从高精度网络进行低精度策略蒸馏,提供了一种有原则且实用的训练 RL 智能体的方法。作为一个应用,我们在 10 种不同的 ATARI 游戏上,通过将一系列游戏帧转换为离散动作,在低功耗神经形态硬件上实现了实时端到端的游戏运行。
引用
@article{arxiv.1809.09260,
title = {Low Precision Policy Distillation with Application to Low-Power, Real-time Sensation-Cognition-Action Loop with Neuromorphic Computing},
author = {Jeffrey L Mckinstry and Davis R. Barch and Deepika Bablani and Michael V. Debole and Steven K. Esser and Jeffrey A. Kusnitz and John V. Arthur and Dharmendra S. Modha},
journal= {arXiv preprint arXiv:1809.09260},
year = {2018}
}