中文

自适应替代梯度用于脉冲神经网络中的序列强化学习

人工智能 2025-10-29 v1 机器人学

摘要

神经形态计算系统将通过实现数量级的能源效率提升,同时实现原生时序处理,来革命能源受限的机器人领域。脉冲神经网络(SNN)作为这些系统的有前景的算法方法,然而其应用于复杂控制任务面临两个关键挑战:(1)脉冲神经元的不可微性性质导致替代梯度的优化属性不明确,(2)SNN的状态动态性质要求在序列上进行训练,而在强化学习(RL)中,这受限于早期训练中的序列长度,阻止了网络从其热身期跨越。我们通过系统性地分析替代梯度斜率设置,表明较浅的斜率会增加深层网络中的梯度幅度,但减少与真实梯度的对齐。在监督学习中,我们发现固定斜率与计划斜率没有明确的偏好。在RL环境中,效果更为显著,较浅的斜率或计划斜率可实现训练和最终部署性能的提升2.1倍。接下来,我们提出一种新颖的训练方法,利用受限于引导策略来引导学习过程,同时仍利用在线环境交互的脉冲策略。结合我们的方法和自适应斜率计划进行实际无人机位置控制任务,我们实现了平均400分的回报,显著优于先前技术,包括行为克隆和TD3BC,在相同条件下最多只能实现--200分。这项工作推进了脉冲神经网络替代梯度学习的理论理解,并为神经形态控制器在实际机器人系统中的实用训练方法提供了支持。

关键词

引用

@article{arxiv.2510.24461,
  title  = {Adaptive Surrogate Gradients for Sequential Reinforcement Learning in Spiking Neural Networks},
  author = {Korneel Van den Berghe and Stein Stroobants and Vijay Janapa Reddi and G. C. H. E. de Croon},
  journal= {arXiv preprint arXiv:2510.24461},
  year   = {2025}
}