USTBench:评估LLMs作为城市智能体的时空推理能力
人工智能
2025-05-26 v1
摘要
大型语言模型(LLMs)在时空推理方面展现出新兴潜力,使其成为构建支持多样化城市下游应用的智能体的有前景候选者。尽管有这些优势,现有研究主要关注评估城市LLM智能体在结果层面指标(如预测精度、交通效率)上的表现,对其底层推理过程提供有限的洞察。因此,城市LLM智能体在时空推理方面的优势与局限仍了解甚少。为此,我们引入USTBench——首个评估LLMs作为城市智能体在四个分解维度上的时空推理能力的基准:时空理解、预测、规划以及带反馈的反思。具体而言,USTBench支持五种多样化的城市决策任务和四种时空预测任务,均在我们构建的交互式城市环境UAgentEnv中运行。该基准包含62,466个结构化QA对用于过程级评估和标准化的端到端任务评估,实现细粒度诊断和跨多样城市场景的广泛任务级比较。通过对十三种主流LLMs的广泛评估,我们揭示尽管LLMs在各种城市下游任务中展现出有前景的潜力,但它们在长期规划和动态城市环境中的反思性适应方面仍然存在困难。值得注意的是,最近训练于通用逻辑或数学问题的先进推理模型(如DeepSeek-R1)并不始终优于非推理LLMs。这一差异凸显了需要领域专用适应方法来增强城市时空推理。总体而言,USTBench为构建更具适应性和有效性的基于LLM的城市智能体及更广泛的智慧城市应用奠定了基础。
引用
@article{arxiv.2505.17572,
title = {USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning of LLMs as Urban Agents},
author = {Siqi Lai and Yansong Ning and Zirui Yuan and Zhixi Chen and Hao Liu},
journal= {arXiv preprint arXiv:2505.17572},
year = {2025}
}