中文

农业中的多标签实例级通用视觉 grounding

计算机视觉与模式识别 2026-03-10 v1

摘要

理解田间图像(如检测植物并区分单个作物和杂草实例)是精密农业的核心挑战。尽管在诗言生成和视觉问答等视觉语言任务方面取得了进展,但视觉 grounding(VG)——定位语言指称对象——在农业领域仍未得到探索。这一原因在于,缺乏适合评估在田间条件下进行 grounding 模型的合适基准数据集,其中许多植物外观高度相似,尺度多样,且被指称的目标可能不存在于图像中。为此,我们引入 gRef-CW,这是首个为农业设计的通用视觉 grounding 数据集,包括负向表达。对当前最先进的 grounding 模型在 gRef-CW 上的基准测试揭示了显著的领域差距,凸显了其在作物和杂草实例 grounding 方面的不足。针对这些发现,我们引入 Weed-VG,一个模块化框架,集成了多标签分层相关性评分和插值驱动的回归。Weed-VG 推动了实例级视觉 grounding,并为开发农业领域的 VG 方法提供了清晰的基准。代码将在接受后发布。

关键词

引用

@article{arxiv.2603.06699,
  title  = {Multi-label Instance-level Generalised Visual Grounding in Agriculture},
  author = {Mohammadreza Haghighat and Alzayat Saleh and Mostafa Rahimi Azghadi},
  journal= {arXiv preprint arXiv:2603.06699},
  year   = {2026}
}