基于自监督视觉Transformer的多标签植物物种分类
计算机视觉与模式识别
2024-07-10 v1 信息检索
机器学习
摘要
我们提出了一种使用自监督视觉Transformer(DINOv2)的迁移学习方法,用于PlantCLEF 2024竞赛,专注于多标签植物物种分类。我们的方法利用基础版和微调版的DINOv2模型来提取通用特征嵌入。我们训练分类器,使用这些丰富的嵌入来预测单张图像中的多个植物物种。为了应对大规模数据集的计算挑战,我们采用Spark进行分布式数据处理,确保在集群中的工作节点间实现高效的内存管理和处理。我们的数据处理流程将图像转换为图块网格,对每个图块进行分类,并将这些预测聚合为一组统一的概率。我们的结果证明了将迁移学习与先进数据处理技术相结合用于多标签图像分类任务的有效性。我们的代码可在https://github.com/dsgt-kaggle-clef/plantclef-2024获取。
引用
@article{arxiv.2407.06298,
title = {Multi-Label Plant Species Classification with Self-Supervised Vision Transformers},
author = {Murilo Gustineli and Anthony Miyaguchi and Ian Stalter},
journal= {arXiv preprint arXiv:2407.06298},
year = {2024}
}
备注
Paper submitted to CLEF 2024 CEUR-WS