中文

CityEQA:基于城市空间的嵌入式问答基准中的层次化 LLM 智能体

人工智能 2025-05-23 v3

摘要

嵌入式问答 (EQA) 主要聚焦于室内环境,留下了城市场景——涵盖环境、动作和感知等复杂性——的探索不足。为填补这一差距,我们引入了一个新任务:在动态城市空间中通过主动探索回答开放词汇问题的嵌入式智能体。为支持该任务,我们提出 CityEQA-EC,首个包含 1,412 个人工标注任务的基准数据集,跨越六个类别,基于真实的 3D 城市模拟器构建。此外,我们提出 Planner-Manager-Actor (PMA),一种专为 CityEQA 设计的新型智能体。PMA 实现长期计划和层次化任务执行:Planner 将问答任务分解为子任务,Manager 在过程控制期间维护以对象为中心的认知地图以进行空间推理,专用 Actor 处理导航、探索和收集子任务。实验表明,PMA 在人类水平的回答准确率上达到 60.7%,显著优于竞争性基线。尽管有希望,但与人类水平的差距仍突出表明 CityEQA 中需要增强视觉推理。本工作为未来的城市空间智能发展指明了道路。数据集和代码均可在 https://github.com/BiluYong/CityEQA.git 获取。

关键词

引用

@article{arxiv.2502.12532,
  title  = {CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space},
  author = {Yong Zhao and Kai Xu and Zhengqiu Zhu and Yue Hu and Zhiheng Zheng and Yingfeng Chen and Yatai Ji and Chen Gao and Yong Li and Jincai Huang},
  journal= {arXiv preprint arXiv:2502.12532},
  year   = {2025}
}