中文

视觉语言模型能否从天空思考?统一无人机推理与生成

计算机视觉与模式识别 2026-05-08 v2

摘要

视觉语言模型在地面视角的视觉理解方面取得了显著进展,但在高空无人机场景中仍显脆弱,因对象微小且密集、纹理重复且俯视姿态模糊。我们引入 UAVReason,一个大规模无人机原生数据集和评估套件,用于研究这种仰视域迁移下的统一空中推理与生成。UAVReason 将 RGB 图像、深度图、语义分割掩码、标题、问答对在一致的空中域中对齐。它包含 23.6K 标注帧、273K VQA 对,其中包括 68.2K 双帧时序问题,以及 188.8K 跨模态生成样本,覆盖 RGB、深度和分割三个模态。我们进一步将 UAVReason-Bagel 作为统一理解与生成基线,联合优化语言推理和稠密视觉生成目标。实验表明,通用 VLMs 和即插即用的统一生成器在无人机原生 grounding 上难以胜任,而 UAVReason-Bagel 相较于其预训练版本在 VQA-1F F1 从 0.394 提升至 0.711,VQA-2F F1 从 0.427 提升至 0.822,heading-aware VQA F1 从 0.798 提升至 0.973。在生成任务上,将分割 mIoU 提升至 0.143,将 KID 从 0.078 降低至 0.048,用于深度-分割-文本条件下的 RGB 合成。更重要的是,我们的消融实验揭示了合成与推理之间的双向协同:稠密生成目标提高了时序语义一致性,而语言层面的推理则正则化稀疏条件图像合成。这些结果表明,统一的推理与生成为物理驱动的空中智能提供了有效的几何感知结构先验。所有数据、代码和评估工具将对外公开发布。

关键词

引用

@article{arxiv.2604.05377,
  title  = {Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation},
  author = {Jintao Sun and Gangyi Ding and Donglin Di and Hu Zhang and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2604.05377},
  year   = {2026}
}

备注

21 pages, 12 figures, 7 tables