中文

面向动物图像零样本聚类的 Vision Transformer:比较基准研究

计算机视觉与模式识别 2026-02-05 v1 人工智能

摘要

动物图像的手动标注仍是生态学研究中的重要瓶颈,限制了生物多样性监测规模与效率。这一研究探讨了最新 Vision Transformer (ViT) 基础模型能否直接将数千张无标签动物图像聚类为物种水平。我们提出一个全面的基准测试框架,对五种 ViT 模型结合五种降维技术和四种聚类算法进行评估(两种有监督,两种无监督),覆盖 60 个物种(30 个哺乳动物和 30 个鸟类),每个测试随机选取 200 张经验证的图像。我们探讨了在物种水平聚类成功的情况、失败原因,以及是否可以在物种水平内部揭示生态学有意义的模式,如性别、年龄或表型差异。我们的结果显示,使用 DINOv3 嵌入结合 t-SNE 和有监督层次聚类方法可实现接近完美的物种水平聚类 (V-measure: 0.958)。无监督方法实现了具竞争力的性能 (0.943),且无需物种先验知识,仅将 1.14% 的图像识别为需专家审核的异常值。我们进一步展示了对现实长尾分布的鲁棒性,并表明刻意的过聚类可可靠地提取种内变异,包括年龄、性别差异和毛色差异。我们引入一个开源基准测试工具箱,为生态学家选择针对特定物种和数据的合适方法提供建议。

关键词

引用

@article{arxiv.2602.03894,
  title  = {Vision Transformers for Zero-Shot Clustering of Animal Images: A Comparative Benchmarking Study},
  author = {Hugo Markoff and Stefan Hein Bengtson and Michael Ørsted},
  journal= {arXiv preprint arXiv:2602.03894},
  year   = {2026}
}