中文

WildRoadBench:野生空中道路损伤 grounding基准数据集

计算机视觉与模式识别 2026-05-21 v1 机器学习

摘要

我们介绍WildRoadBench,一个野生空中道路损伤 grounding基准数据集,将视觉语言模型的直接视觉 grounding与LLM驱动的自主研究与工程相结合,均基于单个专业标注的无人机语料库。该数据集在两个协议下评估相同的图像集和相同的每类AP_50指标。VLM轨道测量固定视觉语言模型是否能在统一的提示、解码和解析管道下,从单张图像和一个简短提示中定位特定领域的损伤。Agent轨道测量仅凭书面任务简报、小型探索性切片和固定交互预算,是否能够搜索公共网络、调整预训练组件、编写训练和推理代码,并通过标量反馈oracle在隐藏的holdout集上提交预测。我们对广泛的闭源前沿模型和开源VLMs,以及多个前沿LLM驱动的agent进行基准测试。两个轨道在此野生环境中均远未达到可靠性能:闭源前沿模型领先VLM榜单,但仍在指标上缺失超过一半;开源 grounding器在它们之下停滞,新的一代或推理风格变体在 grounding方面不一致地未提升;小目标在每个开源模型中都崩溃;agent在最强VLM之后滞后,尽管拥有更丰富的 affordances,多个agent甚至无法在预算内提交有效提交物。我们在https://anonymous.4open.science/r/wildroadbench-0607发布代码和数据,以支持可重复的后续研究。

关键词

引用

@article{arxiv.2605.20306,
  title  = {WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents},
  author = {Bingnan Liu and Chenhang Cui and Rui Huang and Jiani Luo and Zhirong Shen and Tinghao Wang and Xiande Huang and Lingbei Meng and Fei Shen and An Zhang},
  journal= {arXiv preprint arXiv:2605.20306},
  year   = {2026}
}

备注

Preprint. Under review. 4 figures, 6 tables