中文

MobilityBench:用于评估现实场景中路径规划智能体的基准

人工智能 2026-02-27 v1

摘要

由大型语言模型(LLM)驱动的路径规划智能体已成为通过自然语言交互和工具介导决策来支持日常人类移动的有前景的范例。然而,受多样化的路由需求、非确定性地图服务以及可重复性有限的限制,现实场景下的系统评估仍面临挑战。本研究中,我们引入MobilityBench,一个用于评估LLM驱动的路径规划智能体在现实场景中的可扩展基准。MobilityBench由来自Amap收集的大规模匿名真实用户查询构成,覆盖全球多个城市广泛的路径规划意图。为实现可重复的端到端评估,我们设计了确定性API回放沙箱,以消除来自实时服务的环境波动。我们进一步提出以结果有效性为中心的多维评估协议,并辅以指令理解、规划、工具使用和效率等方面的评估。使用MobilityBench,我们评估了多个LLM驱动的路径规划智能体在多样化现实场景中的表现,并对其行为和性能进行深入分析。我们的发现表明,当前模型在基本信息检索和路径规划任务中表现良好,但在偏好约束路径规划方面仍有显著不足,凸显了在个性化移动应用方面仍有大量提升空间。我们公开发布了基准数据、评估工具包和文档,地址为https://github.com/AMAP-ML/MobilityBench。

关键词

引用

@article{arxiv.2602.22638,
  title  = {MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios},
  author = {Zhiheng Song and Jingshuai Zhang and Chuan Qin and Chao Wang and Chao Chen and Longfei Xu and Kaikui Liu and Xiangxiang Chu and Hengshu Zhu},
  journal= {arXiv preprint arXiv:2602.22638},
  year   = {2026}
}