基于视觉语言对齐的多域作物-杂草语义定位
计算机视觉与模式识别
2026-03-02 v1
摘要
精细作物-杂草分割对于实现精密农业中的精准除草剂应用至关重要。然而,现有的深度学习模型由于依赖于数据集特定的视觉特征,在面对异构农业环境时难以泛化。我们提出了视觉语言杂草分割框架(VL-WS),以解决这一限制,方法是将像素级分割锚定在语义对齐的、域无关的表征中。我们的体系结构采用双编码器设计,其中冻结的对比语言-图像预训练(CLIP)嵌入与任务特定的空间特征通过以自然语言标题为条件的特征级线性调制(FiLM)层进行融合和调制。该设计使图像级文本描述能够引导通道级特征细化,同时保持细粒度的空间定位。与仅在单源数据集上进行训练和评估的先前工作不同,VL-WS 在包括近距离地面图像(机器人平台)和高空无人机图像于内的统一语料库上进行训练,涵盖多种作物类型、杂草种类、生长阶段以及感知条件。实验结果表明,在四个基准数据集上,VL-WS 有效实现了框架,VL-WS 实现了平均 Dice 评分为 91.64%,超越 CNN 基线 4.98%。在最具挑战性的杂草类别上,VL-WS 达到了 80.45% 的 Dice 评分,高于最佳基线的 65.03%,提升了 15.42%。VL-WS 还在受限目标域监督下维持了稳定的杂草分割性能,表明其具有更好的泛化性和数据效率。这些发现凸显了视觉语言对齐在实现跨 diverse 实际农业领域可部署的、标签高效分割模型方面的潜力。
引用
@article{arxiv.2602.23677,
title = {Vision-Language Semantic Grounding for Multi-Domain Crop-Weed Segmentation},
author = {Nazia Hossain and Xintong Jiang and Yu Tian and Philippe Seguin and O. Grant Clark and Shangpeng Sun},
journal= {arXiv preprint arXiv:2602.23677},
year = {2026}
}