中文

基于卷积神经网络的 DeliveryBench:真实世界中智能体能否获取利润?

人工智能 2025-12-23 v1

摘要

大语言模型(LLM)和视觉语言模型(VLM)正在作为具身智能体部署,但现有基准主要围绕简单短期任务,难以捕捉塑造真实世界决策的丰富约束。为弥合这一差距,我们提出 DeliveryBench,一个基于真实世界食物配送职业的城市规模具身基准测试。食物骑手自然面临长期目标(在数小时内最大化净利润),同时需管理多种约束条件,如配送截止时间、交通费用、车辆电池以及与其他骑手和客户的必要互动。DeliveryBench 在程序化生成的3D城市中实现,涵盖多样化的道路网络、建筑物、功能地点、交通方式以及真实资源动态,系统化评估约束感知、长期规划能力。我们在九个城市中对VLM-based智能体进行基准测试,并与人类玩家进行比较。结果显示,这些智能体与人类的性能存在显著差距,发现这些智能体目光短浅,经常违反基本常识约束。此外,我们观察到不同模型之间存在显著的性格差异(如开放型GPT-5 vs. 保守型Claude),凸显当前VLM-based具身智能体在现实、约束密集环境中的脆弱性与多样性。我们的代码、数据和基准测试已在 https://deliverybench.github.io 提供。

关键词

引用

@article{arxiv.2512.19234,
  title  = {DeliveryBench: Can Agents Earn Profit in Real World?},
  author = {Lingjun Mao and Jiawei Ren and Kun Zhou and Jixuan Chen and Ziqiao Ma and Lianhui Qin},
  journal= {arXiv preprint arXiv:2512.19234},
  year   = {2025}
}