中文

通过原型引导实现多标签植物物种的零样分割

人工智能 2025-12-24 v1

摘要

本文提出了一种方法,用于解决PlantClef 2025挑战问题,即对高分辨率图像进行精细的多标签物种识别。我们的解决方案侧重于利用来自训练数据集获得的类别原型作为训练Vision Transformer(ViT)的引导,以适应测试集图像。在获取这些表示之前,我们从训练数据集图像中提取特征,并通过K-Means聚类,其中K等于数据集中的类别数。分割模型是定制的窄型ViT,通过替换patch嵌入层为冻结的DinoV2(在训练数据集中针对单个物种进行预训练)实现。该模型被训练以从测试数据集图像中重建训练数据集的类别原型。我们随后使用该模型获取注意力得分,以识别和定位感兴趣的区域,从而指导分类过程。该方法实现了从多类单物种识别到高分辨率植被图块的多标签分类之间的领域适应。我们的方法在PlantCLEF 2025挑战的私有排行榜上获得了第五名,F1分为0.33331。此外,就绝对值而言,我们的方法得分比顶尖提交方案低0.03,表明在该基准任务中可能实现了有竞争力的性能。我们的代码可在https://github.com/ADAM-UEFS/PlantCLEF2025获取。

关键词

引用

@article{arxiv.2512.19957,
  title  = {Zero-Shot Segmentation through Prototype-Guidance for Multi-Label Plant Species Identification},
  author = {Luciano Araujo Dourado Filho and Almir Moreira da Silva Neto and Rodrigo Pereira David and Rodrigo Tripodi Calumby},
  journal= {arXiv preprint arXiv:2512.19957},
  year   = {2025}
}