基于瓦片的 ViT 推理,结合视觉聚类先验实现零样本多物种植物识别
计算机视觉与模式识别
2025-07-09 v1 信息检索
机器学习
摘要
我们描述了 DS@GT 在 PlantCLEF 2025 挑战中获得的第二名解决方案,该挑战旨在 vegetation 图像中的多物种植物识别。我们的管道组合了 (i) 用于 patch 级别推理的微调 Vision Transformer ViTD2PC24All,(ii) 将 patch 大小与网络 518x518 感受野对齐的 4x4 瓦片策略,以及 (iii) 通过 PaCMAP + K-Means 视觉聚类和地理位置过滤实现的领域先验适应。瓦片预测通过多数投票聚合,并结合聚类特定的贝叶斯先验进行重新加权,实现了在私有排行榜上达到 0.348 的宏平均 F1 分数,同时无需额外训练。所有代码、配置文件和可重复性脚本均公开 available at https://github.com/dsgt-arc/plantclef-2025。
引用
@article{arxiv.2507.06093,
title = {Tile-Based ViT Inference with Visual-Cluster Priors for Zero-Shot Multi-Species Plant Identification},
author = {Murilo Gustineli and Anthony Miyaguchi and Adrian Cheung and Divyansh Khattak},
journal= {arXiv preprint arXiv:2507.06093},
year = {2025}
}