中文

AirSpatialBot:用于细粒度车辆属性识别与检索的空间感知航空代理

计算机视觉与模式识别 2026-01-06 v1

摘要

尽管远程感知视觉语言模型(VLM)取得了显著进展,但现有模型在空间理解方面常常不足,限制了其在实际应用中的效果。为推动远程感知领域的VLM发展,我们聚焦于无人机拍摄的车辆图像,构建空间感知数据集AirSpatial,包含超过20.6万条指令,提出两种新任务:空间定位和空间问答。它是首个提供3DBB(3D Bounding Box)的远程感知定位数据集。为有效将现有VLM的图像理解能力迁移至空间领域,我们采用两阶段训练策略:图像理解预训练与空间理解微调。基于该训练得到的空间感知VLM,我们开发了航空代理AirSpatialBot,具备细粒度车辆属性识别与检索能力。通过动态整合任务规划、图像理解、空间理解与任务执行能力,AirSpatialBot能够适应多样化的查询需求。实验结果验证了我们方法的有效性,揭示了现有VLM的空间局限性,并提供了宝贵的改进思路。模型、代码及数据集将发布于 https://github.com/VisionXLab/AirSpatialBot

关键词

引用

@article{arxiv.2601.01416,
  title  = {AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval},
  author = {Yue Zhou and Ran Ding and Xue Yang and Xue Jiang and Xingzhao Liu},
  journal= {arXiv preprint arXiv:2601.01416},
  year   = {2026}
}

备注

12 pages, 9 figures