中文

次优且类特质的强化学习策略与中脑预测误差编码相关

神经元与认知 2021-12-09 v1

摘要

在概率学习过程中,生物体常采用次优的“概率匹配”策略,即选择率与奖励概率相匹配,而非采用最优的“最大化”策略,即总是选择奖励概率最高的选项。尽管已有数十年的研究,导致概率匹配的机制仍存在争议,尤其值得注意的是,在脑活动层面尚未报道概率匹配与最大化策略之间存在差异。在此,我们为一个计算模型提供了理论证明,该模型能够解释从纯粹最大化到纯粹概率匹配之间的全部行为范围。将该模型拟合到 60 名参与者在 fMRI 扫描期间执行概率强化学习任务的行为数据,证实了模型推导出的预测:概率匹配与学习过程中对负性结果的整合增强有关,表现为中脑 BOLD 信号与负预测误差之间更强的耦合。由于个体在九种不同条件下表现出的概率匹配程度是一致的,我们的结果进一步表明,表现出特定学习策略的倾向是个体的一种类特质特征。

关键词

引用

@article{arxiv.2112.04327,
  title  = {Suboptimal and trait-like reinforcement learning strategies correlate with midbrain encoding of prediction errors},
  author = {Liran Szlak and Kristoffer Aberg and Rony Paz},
  journal= {arXiv preprint arXiv:2112.04327},
  year   = {2021}
}