UAV-VL-R1:通过监督微调和多阶段GRPO实现视觉语言模型的通用化用于无人机视觉推理
计算机视觉与模式识别
2026-05-07 v2
摘要
近年来,视觉语言模型(VLM)在自然图像任务上展现出强大的泛化能力。然而,这些模型在无人机(UAV)基于航空图像上的性能常常下降,由于这些图像具有高分辨率、复杂的空间语义以及严格的实时性限制。这些挑战限制了通用型VLM在结构化航空推理任务中的应用。为此,我们提出UAV-VL-R1,一个专为航空视觉推理设计的轻量级VLM。它采用结合监督微调(SFT)和多阶段强化学习(RL)的混合训练方法。我们利用组相对策略优化(GRPO)算法通过规则引导的奖励和组内策略对齐来促进结构化且可解释的推理。为支持模型训练和评估,我们引入了一个高分辨率视觉问答数据集HRVQA-VL,包含50,019个标注样本,覆盖八个无人机相关推理任务,包括目标计数、运输识别和空间场景推断。实验结果表明,UAV-VL-R1在零样本准确率上比Qwen2-VL-2B-Instruct基线提高了48.17%,甚至在多个任务上超越了其72B规模变体(该变体规模是其36倍)。消融研究揭示,尽管SFT改善了语义对齐,但可能降低数学任务中的推理多样性。GRPO-based RL通过增强逻辑灵活性和推理鲁棒性来补偿这一限制。此外,UAV-VL-R1在FP16推理下仅需3.9GB内存,可量化为2.5GB(INT8),支持在资源受限的无人机平台上实时部署。
引用
@article{arxiv.2508.11196,
title = {UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning},
author = {Jiajin Guan and Haibo Mei and Bonan Zhang and Dan Liu and Yuanshuang Fu and Yue Zhang},
journal= {arXiv preprint arXiv:2508.11196},
year = {2026}
}
备注
The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: 10.1007/s11704-026-52082-z