GRSN:用于 POMDP 和 MARL 的门控循环脉冲神经元
神经与进化计算
2024-04-25 v1 人工智能
机器学习
多智能体系统
摘要
脉冲神经网络(SNN)因其节能和快速推理能力而在各类领域得到广泛应用。将 SNN 应用于强化学习(RL)可显著降低智能体的计算资源需求,并在资源受限条件下提升算法性能。然而,当前的脉冲强化学习(SRL)算法只能将多时间步的仿真结果对应到单步决策,这与大脑中实际的时序动力学存在显著差异,也未能充分发挥 SNN 处理时序数据的潜力。为解决时序错位问题并充分发挥脉冲神经元内在时序动力学,本文提出了一种新型时序对齐范式(TAP),利用脉冲神经元的单步更新累积历史状态信息,并引入门控单元增强脉冲神经元的记忆容量。实验结果表明,我们的方法在性能上与循环神经网络(RNN)相似,但功耗约为其 50%,能够解决部分可观测马尔可夫决策过程(POMDP)和多智能体协作问题。
引用
@article{arxiv.2404.15597,
title = {GRSN: Gated Recurrent Spiking Neurons for POMDPs and MARL},
author = {Lang Qin and Ziming Wang and Runhao Jiang and Rui Yan and Huajin Tang},
journal= {arXiv preprint arXiv:2404.15597},
year = {2024}
}