中文

迈向精确的无人机图像感知:以更强的任务提示引导视觉-语言模型

计算机视觉与模式识别 2025-12-09 v1 人工智能

摘要

现有基于视觉-语言模型(VLM)的图像感知方法通常遵循一种范式,即模型根据用户提供的文本任务提示来提取和分析图像内容。然而,此类方法在应用于无人机图像时面临局限性,无人机图像呈现出目标混淆、尺度变化和复杂背景等挑战。这些挑战的产生是因为 VLM 对图像内容的理解依赖于视觉标记和文本标记之间的语义对齐。当任务提示简单而图像内容复杂时,实现有效对齐变得困难,从而限制了模型聚焦于任务相关信息的能力。为解决这一问题,我们提出了 AerialVP,这是首个用于无人机图像感知中任务提示增强的智能体框架。AerialVP 主动从无人机图像中提取多维辅助信息以增强任务提示,克服了传统基于 VLM 的方法的局限性。具体而言,增强过程包括三个阶段:(1)分析任务提示以识别任务类型和增强需求,(2)从工具库中选择适当的工具,以及(3)基于分析和所选工具生成增强的任务提示。为评估 AerialVP,我们引入了 AerialSense,这是一个用于无人机图像感知的综合基准,包含空中视觉推理、空中视觉问答和空中视觉定位任务。AerialSense 为评估模型在不同分辨率、光照条件以及城市和自然场景中的泛化能力和性能提供了标准化基础。实验结果表明,AerialVP 显著增强了任务提示引导能力,在开源和专有 VLM 中均实现了稳定且显著的性能提升。我们的工作将在 https://github.com/lostwolves/AerialVP 上公开。

关键词

引用

@article{arxiv.2512.07302,
  title  = {Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts},
  author = {Mingning Guo and Mengwei Wu and Shaoxian Li and Haifeng Li and Chao Tao},
  journal= {arXiv preprint arXiv:2512.07302},
  year   = {2025}
}