中文

尚未达到思维领域的AlphaFold:评估Centaur作为合成参与者

机器学习 2025-08-12 v1 人工智能

摘要

模拟器已彻底改变了自然科学领域的科学实践。通过生成可靠近似真实世界现象的数据,它们使科学家能够加速假设检验和优化实验设计。AlphaFold或许是这一点的最佳例证,这是一个获得诺贝尔奖的化学模拟器,能从氨基酸序列预测蛋白质结构,实现分子相互作用、药物靶点和蛋白质功能的快速原型设计。在行为科学中,一个可靠的参与者模拟器——一种能够在认知任务中产生类人行为的系统——将代表同样变革性的进步。最近,Binz等人推出了Centaur,一个在来自160个实验的人类数据上微调的大型语言模型(LLM),提出其不仅用作认知模型,还用作“实验研究的硅内原型设计”的参与者模拟器,例如,以推进自动化认知科学。在此,我们回顾了参与者模拟器的核心标准,并评估Centaur在多大程度上满足这些标准。尽管Centaur展示了强大的预测准确性,但其生成行为——参与者模拟器的关键标准——系统性地偏离了人类数据。这表明,虽然Centaur是朝着预测人类行为迈出的重要一步,但它尚未达到可靠参与者模拟器或准确认知模型的标准。

关键词

引用

@article{arxiv.2508.07887,
  title  = {Not Yet AlphaFold for the Mind: Evaluating Centaur as a Synthetic Participant},
  author = {Sabrina Namazova and Alessandra Brondetta and Younes Strittmatter and Matthew Nassar and Sebastian Musslick},
  journal= {arXiv preprint arXiv:2508.07887},
  year   = {2025}
}