中文

DepthCropSeg++:利用深度标记数据扩展作物分割基础模型

计算机视觉与模式识别 2026-01-21 v1

摘要

DepthCropSeg++:一个用于作物分割的基础模型,能够在开放田间环境下分割不同作物物种。作物分割是现代农业的一项基础任务,与植物表型分析、密度估计和杂草控制等许多下游任务密切相关。在基础模型时代,已经开发了许多通用的大型语言和视觉模型。这些模型由于显著的模型容量和大规模数据集,展现出了卓越的现实世界泛化能力。然而,由于昂贵的像素级标注成本,当前的作物分割模型大多从有限的数据中学习,通常仅在特定作物类型或受控环境下表现良好。在本工作中,我们遵循先前工作 DepthCropSeg(一种几乎无监督的作物分割方法)的思路,扩展了一个跨物种和跨场景的作物分割数据集,包含 30 多个物种和 15 种环境条件下的 28,406 张图像。我们还基于最先进的语义分割架构 ViT-Adapter 架构,通过动态上采样增强其细节感知能力,并使用两阶段自训练流程训练模型。为了系统验证模型性能,我们进行了全面的实验,以证明其在多个作物数据集上的有效性和泛化能力。结果表明,DepthCropSeg++ 在综合测试集上达到了 93.11% 的 mIoU,显著优于有监督基线模型和通用视觉基础模型(如 Segment Anything Model (SAM))(分别高出 +0.36% 和 +48.57%)。该模型在具有挑战性的场景中尤其出色,包括夜间环境(86.90% mIoU)、高密度冠层(90.09% mIoU)和未见过的作物品种(90.09% mIoU),标志着作物分割领域的新技术水平。

关键词

引用

@article{arxiv.2601.12366,
  title  = {DepthCropSeg++: Scaling a Crop Segmentation Foundation Model With Depth-Labeled Data},
  author = {Jiafei Zhang and Songliang Cao and Binghui Xu and Yanan Li and Weiwei Jia and Tingting Wu and Hao Lu and Weijuan Hu and Zhiguo Han},
  journal= {arXiv preprint arXiv:2601.12366},
  year   = {2026}
}

备注

13 pages, 15 figures and 7 tables