AgroVG:面向农业视觉 grounding 的大规模多来源基准
计算机视觉与模式识别
2026-05-22 v1 人工智能
摘要
视觉 grounding 是将由自然语言表达式描述的对象定位出来的任务,这是农业 AI 系统的基础能力,使其能够实现选择性除草、疾病监测和靶向采收等应用。可靠评估农业视觉 grounding 具有挑战,因为农业目标常常小、重复、遮挡或形状不规则,且指令可能指涉图像中的一个、多个或没有对象。因此,对该能力的评估需要同时测试局部准确性、目标集合完整性和存在感知的放弃。为此,我们引入 AgroVG,一种多来源基准,将农业 grounding 表述为 generalized set prediction:给定图像和指示表达,模型必须返回所有匹配的目标实例或在无目标时放弃。AgroVG 包含 10,071 对带注释图像-查询对,来自十个数据源,涵盖六类目标:作物/杂草、果实、小麦秆、害虫、植物疾病和树冠。它支持跨所有六类家族的边界框 grounding (T1),以及在具有可靠像素级实例标注的来源上的实例掩码 grounding (T2),查询覆盖单目标、多目标和目标缺失三种情形。AgroVG 进一步提供用于 box-set 匹配和查询级掩码覆盖的任务特定协议。对 26 种模型配置进行零样评估,涵盖闭源 MLLMs、开源 VLMs 和专用 grounding 系统,结果显示持续的差距:最佳的多目标 Set-F1 仅达 0.35,最佳的正查询掩码成功率在 [email protected] 时仍低于 0.17。数据和代码均可在 https://anonymous.4open.science/r/AgroVG-5172/ 获取。
关键词
引用
@article{arxiv.2605.22034,
title = {AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding},
author = {Haocheng Li and Juepeng Zheng and Zenghao Yang and Kaiqi Du and Guilong Xiao and Gengmeng Pu and Haohuan Fu and Jianxi Huang},
journal= {arXiv preprint arXiv:2605.22034},
year = {2026}
}
备注
45 pages,12 figures