中文

GRSN:用于 POMDP 和 MARL 的门控循环脉冲神经元

神经与进化计算 2024-04-25 v1 人工智能 机器学习 多智能体系统

摘要

脉冲神经网络(SNN)因其节能和快速推理能力而在各类领域得到广泛应用。将 SNN 应用于强化学习(RL)可显著降低智能体的计算资源需求,并在资源受限条件下提升算法性能。然而,当前的脉冲强化学习(SRL)算法只能将多时间步的仿真结果对应到单步决策,这与大脑中实际的时序动力学存在显著差异,也未能充分发挥 SNN 处理时序数据的潜力。为解决时序错位问题并充分发挥脉冲神经元内在时序动力学,本文提出了一种新型时序对齐范式(TAP),利用脉冲神经元的单步更新累积历史状态信息,并引入门控单元增强脉冲神经元的记忆容量。实验结果表明,我们的方法在性能上与循环神经网络(RNN)相似,但功耗约为其 50%,能够解决部分可观测马尔可夫决策过程(POMDP)和多智能体协作问题。

关键词

引用

@article{arxiv.2404.15597,
  title  = {GRSN: Gated Recurrent Spiking Neurons for POMDPs and MARL},
  author = {Lang Qin and Ziming Wang and Runhao Jiang and Rui Yan and Huajin Tang},
  journal= {arXiv preprint arXiv:2404.15597},
  year   = {2024}
}