中文

群体编码与动态神经元改进的脉冲动作网络用于强化学习

人工智能 2022-09-23 v3

摘要

凭借深度神经网络(DNNs)作为强大的函数逼近器,深度强化学习(DRL)已在机器人控制任务上获得出色表现。相较于采用普通人工神经元的 DNN,具有生物学合理性的脉冲神经网络(SNN)包含多样的脉冲神经元群体,使其天然擅长带有空间与时间信息的状态表示。基于一种混合学习框架——其中脉冲动作网络从状态推断动作、深度评论家网络评估该动作——我们从输入编码与神经元编码两个不同尺度提出群体编码与动态神经元改进的脉冲动作网络(PDSAN),以实现高效状态表示。对于输入编码,我们应用具动态感受野的群体编码直接编码各输入状态分量。对于神经元编码,我们提出不同类型动态神经元(含一阶与二阶神经元动力学)以描述远为复杂的神经元动力学。最终,PDSAN 与深度评论家网络联合使用双延迟深度确定性策略梯度算法(TD3-PDSAN)训练。大量实验结果表明,我们的 TD3-PDSAN 模型在四个 OpenAI gym 基准任务上取得优于先进模型的性能。这是以 SNN 改进 RL 以实现满足生物学合理性的有效计算的重要尝试。

关键词

引用

@article{arxiv.2106.07854,
  title  = {Population-coding and Dynamic-neurons improved Spiking Actor Network for Reinforcement Learning},
  author = {Duzhen Zhang and Tielin Zhang and Shuncheng Jia and Xiang Cheng and Bo Xu},
  journal= {arXiv preprint arXiv:2106.07854},
  year   = {2022}
}