中文

深度与脉冲神经网络强化协同学习用于神经形态硬件上的节能无地图导航

神经与进化计算 2020-08-04 v2 机器学习 机器人学

摘要

节能的无地图导航对移动机器人至关重要,因为它们需在机载资源有限的情况下探索未知环境。尽管近期的深度强化学习(DRL)方法已成功应用于导航,但其高能耗限制了其在若干机器人应用中的使用。在此,我们提出一种神经形态方法,将脉冲神经网络的能效与DRL的最优性相结合,并在无地图导航的学习控制策略中对其进行基准测试。我们的混合框架——脉冲深度确定性策略梯度(SDDPG)——由一个脉冲执行者网络(SAN)和一个深度评论者网络组成,两个网络使用梯度下降联合训练。协同学习实现了两网络间的协同信息交换,使它们通过共享表征学习克服彼此的局限。为评估我们的方法,我们将训练好的SAN部署在英特尔Loihi神经形态处理器上。在模拟与真实复杂环境中验证时,Loihi上我们的方法每次推理的能耗比Jetson TX2上的DDPG低75倍,并且展现出更高的导航至目标成功率,该成功率介于1%至4.2%之间,取决于前向传播时间步长。这些结果强化了我们在设计用于神经形态硬件控制自主机器人的脑启发算法方面的持续努力。

关键词

引用

@article{arxiv.2003.01157,
  title  = {Reinforcement co-Learning of Deep and Spiking Neural Networks for Energy-Efficient Mapless Navigation with Neuromorphic Hardware},
  author = {Guangzhi Tang and Neelesh Kumar and Konstantinos P. Michmizos},
  journal= {arXiv preprint arXiv:2003.01157},
  year   = {2020}
}

备注

8 pages, 7 figures