中文

基于元数据增强多头视觉Transformer的多标签植物物种预测

计算机视觉与模式识别 2025-08-15 v1 信息检索 机器学习

摘要

我们提出了一种多头视觉Transformer方法,用于植被样方图像中的多标签植物物种预测,以应对PlantCLEF 2025挑战。该任务要求在单物种植物图像上训练模型,同时在多物种样方图像上进行测试,这造成了剧烈的领域偏移。我们的方法利用预训练的DINOv2 Vision Transformer Base (ViT-B/14) 作为骨干网络,并配备多个分类头,分别用于物种、属和科的预测,从而利用分类层级结构。关键贡献包括:用于捕捉不同尺度植物的多尺度切片、基于平均预测长度的动态阈值优化,以及通过装袋法和Hydra模型架构实现的集成策略。该方法融合了多种推理技术,包括用于去除非植物伪影的图像裁剪、用于预测约束的top-n过滤,以及logit阈值策略。实验在约140万张覆盖7,806种植物物种的训练图像上进行。结果展现了强大的性能,使我们的提交在私有排行榜上位列第三。代码见 https://github.com/geranium12/plant-clef-2025/tree/v1.0.0。

关键词

引用

@article{arxiv.2508.10457,
  title  = {Multi-Label Plant Species Prediction with Metadata-Enhanced Multi-Head Vision Transformers},
  author = {Hanna Herasimchyk and Robin Labryga and Tomislav Prusina},
  journal= {arXiv preprint arXiv:2508.10457},
  year   = {2025}
}

备注

Accepted for publication at: LifeCLEF Lab at CLEF 2025 Working Notes, 2025, Madrid, Spain