中文

利用脉冲神经网络与马尔可夫-哈斯斯采样学习控制动态代理

人工智能 2025-07-15 v1 机器人学

摘要

脉冲神经网络(SNNs)因其生物学启发的、能效高的特性,成为传统深度神经网络(DNNs)在实时控制系统中备受青睐的替代方案。然而,其训练面临诸多挑战,尤其是强化学习(RL)任务,因基于脉冲通信的非可微分特性。本文引入了首个采用马尔可夫-哈斯斯采样(Metropolis-Hastings, MH)采样技术训练SNN以控制RL环境中动态代理的框架,无需依赖梯度方法。该方法通过累积奖励信号,迭代提议并以概率方式接受网络参数更新,有效规避了反向传播的局限,使其能直接在神经器平台上进行优化。我们在两个标准控制基准测试(AcroBot和CartPole)上评估了该框架。结果表明,基于MH的方法在最大化累积奖励、最小化网络资源和训练episode方面,均优于传统深度Q学习(DQL)基线及先前的SNN-based RL方法。

关键词

引用

@article{arxiv.2507.09540,
  title  = {Learning to Control Dynamical Agents via Spiking Neural Networks and Metropolis-Hastings Sampling},
  author = {Ali Safa and Farida Mohsen and Ali Al-Zawqari},
  journal= {arXiv preprint arXiv:2507.09540},
  year   = {2025}
}