中文

植物图像表征的自监督学习

计算机视觉与模式识别 2026-05-01 v1

摘要

自动化植物识别在生物多样性监测与保护中起着至关重要的作用,然而当前方法严重依赖监督学习,这受限于专家标注数据的可用性。自监督学习(SSL)提供了一种可扩展的替代方案,但现有方法和训练协议大多为粗粒度视觉任务设计,可能无法很好地迁移到如植物物种识别这样的细粒度领域。在这项工作中,我们研究了用于植物图像表征学习的 SSL。我们表明,SSL 流程中常用的数据增强——如高斯模糊、灰度转换和 solarization——在植物图像背景下是有害的,因为它们移除了对细粒度识别至关重要的细微判别线索。相反,我们确定了更适合该领域的替代变换,包括仿射变换和色调分离。我们进一步证明,在 iNaturalist 2021 Plantae 子集上训练 SimDINOv2 比在 ImageNet-1K 上训练能产生显著更强的表征,这突显了领域特定数据对于 SSL 的重要性。我们的发现在 ViT-Base 和 ViT-Large 架构上均保持一致。此外,我们的模型取得了有竞争力的性能,在小样本设置下的下游植物识别任务中,有时甚至优于强大的监督基线 Pl@ntCLEF 和 BioCLIP。总体而言,我们的结果强调了领域适应的增强策略和数据集选择在自监督学习中的关键重要性,并为构建用于生物多样性监测的可扩展模型提供了实践指南。

关键词

引用

@article{arxiv.2604.27538,
  title  = {Self-Supervised Learning of Plant Image Representations},
  author = {Ilyass Moummad and Kawtar Zaher and Hervé Goëau and Jean-Christophe Lombardo and Pierre Bonnet and Alexis Joly},
  journal= {arXiv preprint arXiv:2604.27538},
  year   = {2026}
}