面向零样本的相机陷阱图像分类
计算机视觉与模式识别
2024-10-17 v1
摘要
本文描述了寻找相机陷阱图像自动分类替代方法的探索过程。首先,我们对使用单一模型对所有图像进行分类的状态-of-the-art 分类器进行基准测试。接着,我们评估了将 MegaDetector 与一个或多个分类器以及 Segment Anything 组合的效果,以评估其对减少特定位置过拟合的影响。最后,我们提出并测试了两种使用大型语言模型和基础模型(如 DINOv2、BioCLIP、BLIP 和 ChatGPT)在零样本场景中的方法。在两个公开数据集(新西兰的 WCT,美国西南部的 CCT20)以及一个私有数据集(中欧的 CEF)上的评估结果表明, 将 MegaDetector 与两个独立的分类器组合 achievable 最高的准确率。这种方法在 CCT20 上将单一 BEiTV2 分类器的相对误差降低约 42%,在 CEF 上降低 48%,在 WCT 上降低 75%。此外,由于背景被移除,新位置上的准确率误差减半。基于 DINOv2 和 FAISS 的提出零样本管道实现了具有竞争力的结果(在 CCT20 上低于 1.0%,在 CEF 上低于 4.7%),这凸显了零样本方法在相机陷阱图像分类中潜在的应用前景。
引用
@article{arxiv.2410.12769,
title = {Towards Zero-Shot Camera Trap Image Categorization},
author = {Jiří Vyskočil and Lukas Picek},
journal= {arXiv preprint arXiv:2410.12769},
year = {2024}
}