中文

CityBench:评估大型语言模型处理城市任务能力的基准

人工智能 2025-06-03 v3 计算与语言 机器学习

摘要

随着大型语言模型 (LLM) 的快速发展和广泛应用,建立系统可靠的评估方法论对于确保 LLM 和视觉语言模型 (VLM) 的实际效果和可靠性至关重要。目前已有一些关于 LLM 处理有限城市任务可行性的早期探索,但仍缺乏系统可扩展的评估基准。构建城市研究的系统评估基准面临数据多样性、应用场景复杂性和城市环境高度动态等挑战。本文设计了 \textit{CityBench},一个基于交互式模拟器的评估平台,作为评估 LLM 处理城市研究中各种任务能力的第一个系统基准。首先,我们构建 \textit{CityData} 来整合多样化的城市数据,以及 \textit{CitySimu} 来模拟城市动态的细粒度行为。基于 \textit{CityData} 和 \textit{CitySimu},我们设计了 8 项代表性城市任务,分为感知-理解和决策-making 两大类,作为 \textit{CityBench}。通过在全球 13 个城市对 30 个著名 LLM 和 VLM 的广泛实验结果,我们发现先进的 LLM 和 VLM 在需要常识和语义理解能力的多样化城市任务(例如理解人类动态和城市图像的语义推断)可实现具竞争力的性能;同时,它们在需要专业知识和高级数值能力的具有挑战性的城市任务(例如地理预测和交通控制任务)中仍会失败。

关键词

引用

@article{arxiv.2406.13945,
  title  = {CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks},
  author = {Jie Feng and Jun Zhang and Tianhui Liu and Xin Zhang and Tianjian Ouyang and Junbo Yan and Yuwei Du and Siqi Guo and Yong Li},
  journal= {arXiv preprint arXiv:2406.13945},
  year   = {2025}
}

备注

Accepted by KDD 2025 D&B Track, https://github.com/tsinghua-fib-lab/CityBench