UAVBench 与 UAVIT-1M:面向低空无人机视觉语言理解的基准测试与增强
计算机视觉与模式识别
2026-03-17 v1
摘要
多模态大语言模型(MLLMs)在自然图像和卫星遥感图像方面取得了显著进展。然而,理解低空无人机场景仍是一个挑战。现有数据集主要聚焦于少数特定低空视觉任务,无法全面评估 MLLMs 在实际低空无人机应用中的能力。因此,我们引入 UAVBench 这一全面基准测试,以及 UAVIT-1M 这一大规模指令调优数据集,用于评估和提升 MLLMs 在低空视觉语言任务中的能力。UAVBench 包含 43 个测试单元和 96 万条高质量数据样本,覆盖图像级和区域级的 10 项任务。UAVIT-1M 包含约 124 万条多样化指令,覆盖 78.9 万张多场景图像,约 2000 种不同的空间分辨率,涵盖 11 项不同任务。UAVBench 和 UAVIT-1M 均来自真实场景,包含丰富的天气条件,并经过人工验证以确保高质量。我们对 11 种最先进的 MLLMs 使用 UAVBench 进行深入分析,发现开源 MLLMs 无法就低空视觉内容生成准确的对话,落后于闭源 MLLMs。广泛的实验表明,在 UAVIT-1M 上对开源 MLLMs 进行微调可显著缓解这一差距。我们的贡献为弥合当前 MLLMs 与低空无人机实际应用需求之间的差距奠定了基础。(项目页面:https://UAVBench.github.io/)
引用
@article{arxiv.2603.14336,
title = {UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding},
author = {Yang Zhan and Yuan Yuan},
journal= {arXiv preprint arXiv:2603.14336},
year = {2026}
}