中文

Decision SpikeFormer:基于脉冲的 Transformer 决策模型

机器学习 2025-04-08 v1 人工智能 神经与进化计算

摘要

离线强化学习(RL)通过仅使用预收集的数据进行策略训练,避免直接与环境交互——这一特性对于能源受限的具身 AI 应用至关重要。尽管人工神经网络(ANN)基于方法在离线 RL 中表现良好,但其高计算和能源需求促使探索更高效的替代方案。脉冲神经网络(SNN)因其低功耗而显示出潜力。本文引入 DSFormer,即首个针对离线 RL 序列建模设计的脉冲驱动 Transformer 模型。与现有专注于视觉任务空间维度的 SNN Transformer 不同,我们开发了 Temporal Spiking Self-Attention (TSSA) 和 Positional Spiking Self-Attention (PSSA) 以捕获 RL 中序列建模所必需的时序和位置依赖性。此外,我们提出了渐进阈值依赖批量归一化(PTBN),该方法结合了 LayerNorm 和 BatchNorm 的优势,既保留了时序依赖性又维持了 SNN 的脉冲性。D4RL 基准中的全面实验结果表明,DSFormer 在 SNN 和 ANN 框架中均表现出色,实现了 78.4% 的能源节省,凸显了 DSFormer 在能源效率和竞争性能方面的优势。代码和模型已公开发布。

关键词

引用

@article{arxiv.2504.03800,
  title  = {Decision SpikeFormer: Spike-Driven Transformer for Decision Making},
  author = {Wei Huang and Qinying Gu and Nanyang Ye},
  journal= {arXiv preprint arXiv:2504.03800},
  year   = {2025}
}

备注

This work has been accepted to CVPR 2025