中文

前额叶规模化调节预测误差读数控制了灵长类动物的奖励驱动适应行为

神经元与认知 2025-12-12 v2

摘要

强化学习(RL)通过奖励预测误差(RPE)实现跨种类的适应行为,但物种特异的可塑性神经起源仍未知。整合RL建模、转录组学和神经影像学进行逆转学习,我们发现RPE信号具有收敛性——单胺类/突触基因上调和神经解剖表征,然而人类在行为上优于猴猿。单试解码显示RPE指导选择在两种物种中相似,但人类比例更大地激活了背内侧岛皮质(dACC)和背外侧前额叶皮质(dlPFC)。跨物种对齐发现,猴猿前额叶回路编码类似人类的最优RPE,却未能将其转化为行动。可塑性规模不随RPE编码保真度,而是随dACC/dlPFC激活范围而增大,这些区域控制RPE到行动的转化。这些发现解决了一个进化之谜:行为表现差距源于执行皮层读数的效率,而非编码容量。

关键词

引用

@article{arxiv.2512.09761,
  title  = {Prefrontal scaling of reward prediction error readout gates reinforcement-derived adaptive behavior in primates},
  author = {Tian Sang and Yichun Huang and Fangwei Zhong and Miao Wang and Shiqi Yu and Jiahui Li and Yuanjing Feng and Yizhou Wang and Kwok Sze Chai and Ravi S. Menon and Meiyun Wang and Fang Fang and Zheng Wang},
  journal= {arXiv preprint arXiv:2512.09761},
  year   = {2025}
}

备注

24 pages, 5 figures