中文

Butter-Bench:评估由大语言模型控制的机器人实用智能

机器人学 2025-10-28 v1 人工智能

摘要

我们提出Butter-Bench,一个评估大语言模型(LLM)控制机器人实用智能的基准测试,实用智能定义为导航物理世界混乱性的能力。当前最先进的机器人系统使用分层架构,LLM负责高层推理,视觉语言动作(VLA)模型负责低层控制。Butter-Bench在与VLA分离的情况下评估LLM部分。尽管LLM在需要分析智能的评估中屡创奇迹,但我们发现人类在Butter-Bench上仍优于LLM。最好的LLM得分仅为40%,而人均得分高达95%。LLM在多步骤空间规划和社会理解方面表现最差。我们还评估了针对具身推理进行微调的LLM,并得出结论,这种训练并不提高其在Butter-Bench上的得分。

关键词

引用

@article{arxiv.2510.21860,
  title  = {Butter-Bench: Evaluating LLM Controlled Robots for Practical Intelligence},
  author = {Callum Sharrock and Lukas Petersson and Hanna Petersson and Axel Backlund and Axel Wennström and Kristoffer Nordström and Elias Aronsson},
  journal= {arXiv preprint arXiv:2510.21860},
  year   = {2025}
}