强化学习智能体中基于高温的神经元脉冲蒸馏
神经与进化计算
2021-08-24 v1 人工智能
机器学习
摘要
脉冲神经网络(SNN)相较于深度神经网络(DNN)具有更快的处理速度、更低的能耗和更强的生物可解释性,有望接近强人工智能。强化学习类似于生物中的学习。研究 SNN 与 RL 的结合具有重要意义。我们提出基于 STBP 的脉冲蒸馏网络(SDN)的强化学习方法。该方法利用蒸馏有效规避 STBP 的弱点,可在分类中达到 SOTA 性能,并获得更小、收敛更快且功耗更低的 SNN 强化学习模型。实验表明,我们的方法比传统 SNN 强化学习和 DNN 强化学习方法收敛更快,约快 1000 个 epoch,并获得比 DNN 小 200 倍的 SNN。我们还将 SDN 部署到 PKU nc64c 芯片上,证明 SDN 比 DNN 功耗更低,且在大规模设备上 SDN 功耗比 DNN 低 600 倍以上。SDN 提供了一种 SNN 强化学习的新途径,并能达到 SOTA 性能,证明了 SNN 强化学习进一步发展的可能性。
引用
@article{arxiv.2108.10078,
title = {Distilling Neuron Spike with High Temperature in Reinforcement Learning Agents},
author = {Ling Zhang and Jian Cao and Yuan Zhang and Bohan Zhou and Shuo Feng},
journal= {arXiv preprint arXiv:2108.10078},
year = {2021}
}
备注
7 pages, 5 figures, conference