中文

利用策略梯度学习用于神经形态控制的首脉冲策略

机器学习 2020-01-23 v3 信号处理 机器学习

摘要

人工神经网络(ANNs)目前被用作许多最先进强化学习(RL)算法中的函数逼近器。脉冲神经网络(SNNs)已证明可通过在稀疏时间二进制脉冲流中编码信息来大幅降低 ANNs 的能耗,从而模拟生物神经元的通信机制。由于其低能耗,SNNs 被视为可在移动设备中实现的协处理器的重要候选者。本工作探索了在节能的首脉冲动作规则下将 SNNs 用作随机策略,即 RL 智能体所采取的动作由输出神经元中首个脉冲的出现决定。考虑到脉冲神经元的广义线性模型(GLM),推导了一种基于策略梯度的算法。实验结果证明了在线训练的 SNNs 作为随机策略能够以由脉冲数衡量的能耗与控制性能之间进行优雅的权衡。与将离线训练的 ANN 转换为 SNN 的标准方法相比,显示出显著增益。

关键词

引用

@article{arxiv.1810.09977,
  title  = {Learning First-to-Spike Policies for Neuromorphic Control Using Policy Gradients},
  author = {Bleema Rosenfeld and Osvaldo Simeone and Bipin Rajendran},
  journal= {arXiv preprint arXiv:1810.09977},
  year   = {2020}
}

备注

Submitted for conference publication