你的 VFM 说话植物吗?面向目标检测的植物语法
计算机视觉与模式识别
2026-04-14 v1
摘要
视觉基础模型 (VFM) 承诺无需任务特定训练数据即可实现零样目标检测,但在复杂农业场景中其表现对文本提示构建高度敏感。我们提出了系统化的提示优化框架,评估四个开放词汇检测器——YOLO World、SAM3、Grounding DINO 和 OWLv2——在牛豆花和果实检测上的表现,涵盖合成和真实田间图像。我们将提示分解为八个维度,进行单因素分析随后进行组合优化,揭示模型对提示结构反应多样:优化一个架构的条件可能使另一个架构崩溃。应用模型特定的组合提示,可显著超过基于物种名的基线,包括在合成牛豆花数据上 YOLO World 的 +0.357 [email protected] 和 OWLv2 的 +0.362 [email protected]。为评估跨任务泛化,我们使用 LLM 将发现的轴结构翻译到形态上不同的目标——牛豆果实——并与使用发现的最优结构进行比较。关键的是,仅在合成数据上优化的提示结构可有效传递到真实田间场景:合成管道提示在大多数模型-对象组合上与在标记真实数据上发现的提示相当或更好(花:YOLO World 为 0.374 vs. 0.353;果:SAM3 为 0.429 vs. 0.371)。我们的发现表明,提示工程可以显著缩小零样 VFM 与监督检测器之间的差距,无需手动标注,而最优提示是模型特定的、不直观的且可跨域迁移的。
引用
@article{arxiv.2604.09920,
title = {Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection},
author = {Lars Lundqvist and Earl Ranario and Hamid Kamangir and Heesup Yun and Christine Diepenbrock and Brian N. Bailey and J. Mason Earles},
journal= {arXiv preprint arXiv:2604.09920},
year = {2026}
}