基于奖励调制 STDP 的首脉冲视觉分类
神经元与认知
2018-07-11 v3 计算机视觉与模式识别
摘要
强化学习 (RL) 近来重新流行,取得了击败欧洲围棋冠军等重大成就。本文首次证明,RL 可有效用于训练脉冲神经网络 (SNN),在无外部分类器的情况下对自然图像进行物体识别。我们采用前馈卷积 SNN 和一种时间编码方案:激活最强的神经元最先发放脉冲,激活较弱的发放较晚或根本不发放。在最高层,每个神经元被分配到一个物体类别,并假定刺激类别即为首个发放脉冲的神经元所属类别。若此假定正确,则该神经元得到奖励,即施加脉冲时间依赖可塑性 (STDP),以增强该神经元的选择性;否则施加反 STDP,促使其学习其他内容。在多种图像数据集 (Caltech、ETH-80 和 NORB) 上的实验表明,这种奖励调制的 STDP (R-STDP) 方法能提取出特别具有判别力的视觉特征,而经典的无监督 STDP 则提取任何持续重复的特征。因此,R-STDP 在这些数据集上优于 STDP。此外,R-STDP 适用于在线学习,并能适应标签置换等剧烈变化。最后,值得一提的是,特征提取和分类均以脉冲完成,每个神经元至多使用一个脉冲,因此该网络硬件友好且能效高。
引用
@article{arxiv.1705.09132,
title = {First-spike based visual categorization using reward-modulated STDP},
author = {Milad Mozafari and Saeed Reza Kheradpisheh and Timothée Masquelier and Abbas Nowzari-Dalini and Mohammad Ganjtabesh},
journal= {arXiv preprint arXiv:1705.09132},
year = {2018}
}
备注
supplementary materials are added, Caltech face/motorbike demonstration figure is updated, some parts of the main manuscript are moved to the supplementary materials, additional network analysis and performance comparison with deep nets are added