CropVLM:用于开放集crop分析的领域适应视觉语言模型
计算机视觉与模式识别
2026-05-06 v1
摘要
高通量植物表型学是现代育种中对可观察植物特征的定量测量,对现代育种至关重要,但仍受制于“表型瓶颈”,即人工数据收集耗时且易受观察者偏好影响。常规封闭集计算机视觉系统无法解决此挑战,因为它们需要大量物种特定标注,且缺乏处理多样化育种群体的灵活性。为弥合这一鸿沟,我们提出 CropVLM,一种通过领域特定语义对齐(DSSA)适应农业领域的视觉语言模型(VLM)。在 52,987 组手动筛选的图像-描述对(覆盖 37 个物种,来自自然田野条件)上训练,CropVLM 有效将农业术语映射到细粒度视觉特征。我们进一步引入混合开放集定位网络(HOS-Net),一种集成 CropVLM 的架构,使其仅凭自然语言描述即可检测新作物,无需重新训练。通过消除对物种特定训练数据的依赖,CropVLM 提供了一种可扩展的高通量表型解决方案,加速遗传增益并促进大规模生物多样性研究,以实现可持续农业。训练好的模型权重及完整管道实现已公开发布:https://github.com/boudiafA/CropVLM。在全面评估中,CropVLM 实现了 72.51% 的零样本分类准确率,优于七个基于 CLIP 的基线方法。我们的检测管道在新物种上显示出卓越的零样本泛化能力,在 CVTCropDet 基准上实现 49.17% AP50,在热带水果种类上实现 50.73% AP50,分别与最佳方法的 34.89% 和 48.58% 相比。
引用
@article{arxiv.2605.03259,
title = {CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis},
author = {Abderrahmene Boudiaf and Sajd Javed},
journal= {arXiv preprint arXiv:2605.03259},
year = {2026}
}