中文

MapTab:多模态大语言模型在异构图上的多准则路线规划是否成熟?

机器学习 2026-05-22 v3

摘要

系统评估多模态大语言模型 (MLLMs) 对推进人工通用智能 (AGI) 至关重要。然而,现有基准不足以严格评估其在多准则约束下的推理能力。为填补这一差距,我们引入 MapTab,一个专为评估 MLLMs 通过路线规划任务进行多准则综合推理的多模态基准测试。MapTab 需要 MLLMs 感知并将来自地图图像的视觉线索与来自结构化表格数据的路线属性(如时间、价格)进行 grounding。该基准包含两个情景:Metromap 覆盖 52 个国家 160 个城市的地铁网络,Travelmap 呈现 19 个国家 168 个代表性旅游景点的情形。总计,MapTab 包含 328 张图像、196,800 条路线规划查询和 3,936 条 QA 查询,所有问题都包含 4 个关键准则:时间、价格、舒适度和可靠性。广泛评估 15 个代表性 MLLMs 显示,当前模型在多准则多模态推理方面面临重大挑战。值得注意的是,在视觉感知有限的情况下,多模态协作往往表现不如单模态方法。我们认为 MapTab 提供了一个具有挑战性和现实感的测试平台,以推动 MLLMs 的系统评估。我们的代码可在 https://github.com/Ziqiao-Shang/MapTab 上获取。

关键词

引用

@article{arxiv.2602.18600,
  title  = {MapTab: Are MLLMs Ready for Multi-Criteria Route Planning in Heterogeneous Graphs?},
  author = {Ziqiao Shang and Lingyue Ge and Zi-Jian Cheng and Shi-Yu Tian and Zhenyu Huang and Wenbo Fu and Weiming Wu and Yang Chen and Xiangwen Zhang and Yulan Hu and Bin Liu and Yu-Feng Li and Lan-Zhe Guo},
  journal= {arXiv preprint arXiv:2602.18600},
  year   = {2026}
}