基于视觉 Transformer 的零样态野生动物分类:评估聚类与连续相似度排序
计算机视觉与模式识别
2025-10-17 v1
摘要
相机陷阱生成数百万野生动物图像,但许多数据集中缺乏来自现有分类器的物种。本文评估了使用自监督视觉 Transformer 对无标记野生动物图像进行组织的零样态方法,这些方法在 Animal Detect 平台上开发并测试,用于相机陷阱分析。我们比较了三种架构(CLIP、DINOv2、MegaDescriptor)结合降维技术(PCA、UMAP)的无监督聚类方法(DBSCAN、GMM),并展示了通过 t-SNE 投影实现连续 1D 相似度排序。在仅用于评估的 5 种物种测试集上,DINOv2 配合 UMAP 和 GMM 实现 88.6% 的准确率(宏平均 F1=0.874),而 1D 排序在哺乳动物和鸟类上达 88.2% 的一致性,在鱼类上达 95.2%,覆盖 1,500 张图片。基于这些发现,我们在生产环境部署了连续相似度排序,实现快速探索性分析,加速了生物多样性监测中的手动标注工作流程。
引用
@article{arxiv.2510.14596,
title = {Zero-Shot Wildlife Sorting Using Vision Transformers: Evaluating Clustering and Continuous Similarity Ordering},
author = {Hugo Markoff and Jevgenijs Galaktionovs},
journal= {arXiv preprint arXiv:2510.14596},
year = {2025}
}
备注
Extended abstract. Submitted to AICC: Workshop on AI for Climate and Conservation - EurIPS 2025 (non-archival)