基于群体编码脉冲神经网络深度强化学习的连续控制
神经与进化计算
2020-10-20 v1 机器学习
机器人学
摘要
随着移动机器人现实世界应用的复杂性日益涉及高维观测与动作空间,而其车载资源有限无法抵消此负担,其节能控制至关重要。一种新兴的非冯·诺依曼智能模型,即在神经形态处理器上运行脉冲神经网络(SNNs),被视为最先进实时机器人控制器在低维控制任务上的节能且鲁棒的替代方案。这一新计算范式当前的挑战是进行扩展以跟上现实任务。为此,SNNs需克服其训练的内在局限,即其脉冲神经元表征信息的能力有限以及缺乏有效学习算法。在此,我们提出一种群体编码脉冲 actor 网络(PopSAN),使用深度强化学习(DRL)与深度 critic 网络联合训练。群体编码方案大幅提升了网络的表征容量,而混合学习结合了深度网络的训练优势与脉冲网络的节能推理。为展示我们方法的普遍适用性,我们将其与一系列同策略和异策略 DRL 算法集成。我们将训练好的 PopSAN 部署在英特尔 Loihi 神经形态芯片上,并针对主流连续控制 DRL 算法进行基准测试。为确保所有方法的公平比较,我们在 OpenAI gym 任务上验证它们。我们的 Loihi 运行 PopSAN 每次推理相比 Jetson TX2 上的深度 actor 网络能耗低 140 倍,且性能水平相同。我们的结果支持了神经形态控制器的效率,并建议当能耗效率与鲁棒性均重要时,我们的混合 RL 可作为深度学习的替代方案。
引用
@article{arxiv.2010.09635,
title = {Deep Reinforcement Learning with Population-Coded Spiking Neural Network for Continuous Control},
author = {Guangzhi Tang and Neelesh Kumar and Raymond Yoo and Konstantinos P. Michmizos},
journal= {arXiv preprint arXiv:2010.09635},
year = {2020}
}
备注
Conference on Robot Learning (CoRL) 2020, 14 pages, 7 figures