中文

面向前沿大推理模型的人类游戏学习者的行为与大脑对齐

人工智能 2026-05-11 v1 神经元与认知

摘要

人类在遇到新环境时能快速学习抽象知识,并灵活部署此知识以指导高效且聪明的行动。现代 AI 系统能否以类似方式学习与规划?我们采用包含并联 fMRI 记录的复杂人类游戏数据集来研究此问题,其中参与者学习需要规则发现、假设修订与多步骤规划的新视频游戏。我们对模型进行联合评估:其在游戏中的表现、匹配人类学习行为以及预测相同任务中的大脑活动,比较前沿大推理模型 (LRMs) 以及基于模型无/基于模型的深度强化学习智能体与贝叶斯理论导向智能体。我们发现,前沿 LRMs 在游戏发现过程中最贴近人类行为模式,并在皮层与次皮层区域预测大脑活动的效果优于两种强化学习替代方案,效果稳健于置换控制。通过针对性干预,我们进一步表明,大脑对齐反映模型对游戏状态的 in-context 表示,而非其下游规划或推理。我们的结果确立了 LRMs 作为人类在复杂自然环境中学习与决策的引人注目的计算模型。项目页面含交互式重放:https://botcs.github.io/reason-to-play/

关键词

引用

@article{arxiv.2605.08019,
  title  = {Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners},
  author = {Botos Csaba and Sreejan Kumar and Austin Tudor David Andrews and Laurence Hunt and Chris Summerfield and Joshua B. Tenenbaum and Rui Ponte Costa and Marcelo G. Mattar and Momchil Tomov},
  journal= {arXiv preprint arXiv:2605.08019},
  year   = {2026}
}