DVGBench:无人机遥感图像中从隐式到显式的视觉 grounding基准
计算机视觉与模式识别
2026-01-06 v1
摘要
遥感大型视觉语言模型(LVLMs)在视觉 grounding(VG)任务中显示出巨大的潜力。然而,现有的遥感VG数据集主要依赖显式指称表达——例如相对位置、相对大小和颜色线索——从而限制了在需要场景特定领域知识的隐式VG任务上的性能。本文介绍DVGBench,一个面向无人机的高质量隐式VG基准,覆盖六大应用场景:交通、灾害、安保、体育、社交活动和生产活动。每个对象都提供了显式和隐式查询。基于该数据集,我们设计了DroneVG-R1,一种集成了新颖的隐式到显式链式思维(I2E-CoT)于强化学习范式中的LVMM。这使模型能够利用场景特定的专业知识,将隐式指称转换为显式指称,从而降低grounding难度。最终,对主流模型在显式和隐式VG任务上的评估揭示了其推理能力的显著局限。这些发现为推进无人机基于智能体的LVMM推理能力提供了可操作的见解。代码和数据集将发布于https://github.com/zytx121/DVGBench
引用
@article{arxiv.2601.00998,
title = {DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models},
author = {Yue Zhou and Jue Chen and Zilun Zhang and Penghui Huang and Ran Ding and Zhentao Zou and PengFei Gao and Yuchen Wei and Ke Li and Xue Yang and Xue Jiang and Hongxin Yang and Jonathan Li},
journal= {arXiv preprint arXiv:2601.00998},
year = {2026}
}
备注
20 pages, 17 figures