利用三值神经元提升脉冲深度 Q-学习的性能
机器学习
2025-06-05 v1 神经与进化计算
系统与控制
系统与控制
摘要
我们提出了一种新的三值脉冲神经元模型,以提升二进制脉冲神经元在深度 Q-学习中的表征能力。尽管三值神经元模型最近被引入以克服二进制脉冲神经元提供的有限表征容量,但我们表明其在深度 Q-学习任务中的性能反而不如二进制模型。我们通过数学和实证分析,将训练过程中的梯度估计偏差假设为潜在原因。我们提出了一种新型三值脉冲神经元模型,通过减少估计偏差来缓解这一问题。我们将所提出的三值脉冲神经元用作深度脉冲 Q-学习网络(DSQN)中的基本计算单元,并在 Gym 环境中的七款 Atari 游戏中评估了该网络的性能。结果表明,所提出的三值脉冲神经元缓解了三值神经元在 Q-学习任务中的剧烈性能退化,并相较于现有二进制神经元提升了网络性能,使 DSQN 成为车载自主决策任务中更实用的解决方案。
引用
@article{arxiv.2506.03392,
title = {Improving Performance of Spike-based Deep Q-Learning using Ternary Neurons},
author = {Aref Ghoreishee and Abhishek Mishra and John Walsh and Anup Das and Nagarajan Kandasamy},
journal= {arXiv preprint arXiv:2506.03392},
year = {2025}
}