中文

MM-UAVBench:评估低空航拖无人机场景下多模态大语言模型的感知、思考与规划能力

计算机视觉与模式识别 2025-12-30 v1

摘要

尽管多模态大语言模型(MLLMs)在各个领域展现出惊人的通用智能,但其在由无人机(UAV)主导的低空场景中的潜力仍基本未被探索。现有的 MLLM 基准测试很少覆盖低空场景的独特挑战,而与 UAV 相关的评估主要聚焦于特定任务如定位或导航,缺乏对 MLLMs 通用智能的统一评估。为填补这一差距,我们提出 MM-UAVBench,一个综合性基准,系统评估 MLLMs 在低空 UAV 场景中的三个核心能力维度:感知、认知和规划。MM-UAVBench 包含 19 个子任务,超过 5.7K 条人工标注问题,全部源自来自公开数据集的真实世界 UAV 数据。对 16 个开源和商业 MLLMs 进行大规模实验,结果显示当前模型在低空场景的复杂视觉和认知需求方面表现不足。我们的分析进一步揭示了空间偏差和多视角理解等关键瓶颈,阻碍了 MLLMs 在 UAV 场景中有效部署。我们希望 MM-UAVBench 将推动未来研究,致力于为真实世界 UAV 智能开发稳健可靠的 MLLMs。

关键词

引用

@article{arxiv.2512.23219,
  title  = {MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?},
  author = {Shiqi Dai and Zizhi Ma and Zhicong Luo and Xuesong Yang and Yibin Huang and Wanyue Zhang and Chi Chen and Zonghao Guo and Wang Xu and Yufei Sun and Maosong Sun},
  journal= {arXiv preprint arXiv:2512.23219},
  year   = {2025}
}

备注

25 pages