基于位置细胞学习灵活奖赏寻求行为的计算理论
神经元与认知
2022-05-18 v2 人工智能
机器学习
神经与进化计算
摘要
计算神经科学中一个重要的开放问题是如何利用位置细胞等各类空间调谐神经元来支持动物奖赏寻求行为的学习。现有计算模型要么缺乏生物学合理性,要么在环境变化时行为灵活性不足。本文提出一种兼具更高生物学合理性与行为灵活性的计算理论。我们首先训练高斯分布混合来建模位置细胞放电野的集群。随后提出一种类赫布规则以学习位置细胞间的突触强度矩阵。该矩阵被解释为连续时间马尔可夫链的转移率矩阵,用于生成位置细胞的序列重放。在重放期间,位置细胞到中等棘神经元(MSN)的突触强度通过类时序差分规则学习,以存储位置-奖赏关联。重放后,当动物接近奖赏位置时 MSN 的激活将逐渐增强,从而动物可沿 MSN 激活增大的方向运动以找到奖赏位置。我们将该理论实现为 MuJoCo 物理模拟器中的高保真虚拟大鼠。在复杂迷宫中,该大鼠相比实现受神经科学启发的强化学习算法深度 Q 网络(deep Q-network)的大鼠,展现出显著更优的学习效率与行为灵活性。
引用
@article{arxiv.2204.11843,
title = {A Computational Theory of Learning Flexible Reward-Seeking Behavior with Place Cells},
author = {Yuanxiang Gao},
journal= {arXiv preprint arXiv:2204.11843},
year = {2022}
}
备注
14 pages, 23 figures