CheeseBench:在啮齿动物行为神经科学范式上评估大型语言模型
人工智能
2026-05-19 v2
摘要
我们引入了 CheeseBench,这是一个在九种经典行为神经科学范式(Morris 水迷宫、Barnes 迷宫、T 迷宫、放射臂迷宫、星形迷宫、操作箱、穿梭箱、条件性位置偏好和延迟非匹配样本任务)上评估大型语言模型 (LLM) 的基准,涵盖六个认知维度。每个任务都基于经过同行评审的啮齿动物实验方案,并附有近似的动物基线。智能体接收一个统一的系统提示,没有特定于任务的指令,必须仅从 ASCII 文本观察和奖励信号中发现目标,就像一只被放入陌生装置的啮齿动物一样。我们在基于文本的 ASCII 渲染上评估了六个开放权重 LLM(参数规模从 3B 到 72B),并与随机基线和基于图的强化学习智能体进行了比较。我们最好的模型 (Qwen2.5-VL-7B) 在 ASCII 输入上达到了 52.6% 的平均成功率,而随机智能体为 32.1%,近似啮齿动物基线为 78.9%。我们发现:(1) 超过 7B 的规模扩展收益递减,(2) 更长的上下文历史会降低性能,(3) 思维链提示有害无益,(4) 视觉-语言架构在 7B 规模上提供了优势,但在 32B 规模上却有害。由于同一模型的性能仅因接口参数不同就在 20% 到 57% 之间变化,这些结果表征的是智能体加接口系统,而非孤立的模型。在这种统一的零样本 ASCII 协议下,当前的开放权重语言模型智能体仍然远低于近似的啮齿动物参考值,尤其是在需要空间导航和试次内状态跟踪的任务上。
引用
@article{arxiv.2604.10825,
title = {CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms},
author = {Zacharie Bugaud},
journal= {arXiv preprint arXiv:2604.10825},
year = {2026}
}
备注
8 pages, 6 figures, 4 tables