中文

你的 VLM 是否具备航空无人机导航能力?面向 UAV 导航的全面空间智能基准测试

计算机视觉与模式识别 2025-11-18 v1

摘要

视觉语言模型(VLM)凭借强大的视觉感知与推理能力,已在无人机(UAV)任务中得到广泛应用。然而,现有 VLM 在 UAV 场景中的空间智能能力仍鲜有探索,引发对其在动态环境中导航与解释方面效能的担忧。为弥合这一差距,我们引入 SpatialSky-Bench,一个为评估 VLM 在 UAV 导航中空间智能能力而设计的全面基准测试。基准测试包含两大类别——环境感知与场景理解,涵盖边界框、颜色、距离、高度及着陆安全分析等 13 个子类别。对各种主流开源与闭源 VLM 进行大规模评估,结果显示在复杂 UAV 导航场景中表现不佳,凸显了其空间能力的显著不足。为此,我们开发了 SpatialSky-Dataset,包含 100 万样本,覆盖多场景的多样化标注。基于此数据集,我们提出 Sky-VLM,一个专为 UAV 空间推理而设计的 VLM,支持多粒度、多情境下的空间推断。大量实验表明,Sky-VLM 在所有基准任务上实现了最先进性能,为开发适用于 UAV 场景的 VLM 铺平了道路。源码已公开于 https://github.com/linglingxiansen/SpatialSKy。

关键词

引用

@article{arxiv.2511.13269,
  title  = {Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation},
  author = {Lingfeng Zhang and Yuchen Zhang and Hongsheng Li and Haoxiang Fu and Yingbo Tang and Hangjun Ye and Long Chen and Xiaojun Liang and Xiaoshuai Hao and Wenbo Ding},
  journal= {arXiv preprint arXiv:2511.13269},
  year   = {2025}
}