你的 VLM 是否具备航空无人机导航能力?面向 UAV 导航的全面空间智能基准测试
计算机视觉与模式识别
2025-11-18 v1
摘要
视觉语言模型(VLM)凭借强大的视觉感知与推理能力,已在无人机(UAV)任务中得到广泛应用。然而,现有 VLM 在 UAV 场景中的空间智能能力仍鲜有探索,引发对其在动态环境中导航与解释方面效能的担忧。为弥合这一差距,我们引入 SpatialSky-Bench,一个为评估 VLM 在 UAV 导航中空间智能能力而设计的全面基准测试。基准测试包含两大类别——环境感知与场景理解,涵盖边界框、颜色、距离、高度及着陆安全分析等 13 个子类别。对各种主流开源与闭源 VLM 进行大规模评估,结果显示在复杂 UAV 导航场景中表现不佳,凸显了其空间能力的显著不足。为此,我们开发了 SpatialSky-Dataset,包含 100 万样本,覆盖多场景的多样化标注。基于此数据集,我们提出 Sky-VLM,一个专为 UAV 空间推理而设计的 VLM,支持多粒度、多情境下的空间推断。大量实验表明,Sky-VLM 在所有基准任务上实现了最先进性能,为开发适用于 UAV 场景的 VLM 铺平了道路。源码已公开于 https://github.com/linglingxiansen/SpatialSKy。
引用
@article{arxiv.2511.13269,
title = {Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation},
author = {Lingfeng Zhang and Yuchen Zhang and Hongsheng Li and Haoxiang Fu and Yingbo Tang and Hangjun Ye and Long Chen and Xiaojun Liang and Xiaoshuai Hao and Wenbo Ding},
journal= {arXiv preprint arXiv:2511.13269},
year = {2025}
}