次优且类特质的强化学习策略与中脑预测误差编码相关
神经元与认知
2021-12-09 v1
摘要
在概率学习过程中,生物体常采用次优的“概率匹配”策略,即选择率与奖励概率相匹配,而非采用最优的“最大化”策略,即总是选择奖励概率最高的选项。尽管已有数十年的研究,导致概率匹配的机制仍存在争议,尤其值得注意的是,在脑活动层面尚未报道概率匹配与最大化策略之间存在差异。在此,我们为一个计算模型提供了理论证明,该模型能够解释从纯粹最大化到纯粹概率匹配之间的全部行为范围。将该模型拟合到 60 名参与者在 fMRI 扫描期间执行概率强化学习任务的行为数据,证实了模型推导出的预测:概率匹配与学习过程中对负性结果的整合增强有关,表现为中脑 BOLD 信号与负预测误差之间更强的耦合。由于个体在九种不同条件下表现出的概率匹配程度是一致的,我们的结果进一步表明,表现出特定学习策略的倾向是个体的一种类特质特征。
引用
@article{arxiv.2112.04327,
title = {Suboptimal and trait-like reinforcement learning strategies correlate with midbrain encoding of prediction errors},
author = {Liran Szlak and Kristoffer Aberg and Rony Paz},
journal= {arXiv preprint arXiv:2112.04327},
year = {2021}
}