基于多模态基础模型的相机陷阱图像零样本动物物种识别
计算机视觉与模式识别
2023-11-03 v1 机器学习
摘要
由于环境状况恶化和人类活动增加,针对野生动物的保护工作至关重要。运动激活的相机陷阱构成了在全球追踪和监测野生动物种群的高效工具。监督学习技术已成功部署用于分析此类图像,但训练这类技术需要专家标注。因此,减少对昂贵标注数据的依赖在开发大规模野生动物追踪方案方面具有巨大潜力,可显著减少人力。本工作中我们提出 WildMatch,一种利用多模态基础模型的新型零样本物种分类框架。具体而言,我们对视觉-语言模型进行指令微调,使其使用与专家类似的术语生成相机陷阱图像的详细视觉描述。然后,我们将生成的描述与外部描述知识库进行匹配,以零样本方式确定物种。我们研究了构建用于详细动物描述生成的指令微调数据集的技术,并提出了一种新颖的知识增强技术以提升描述质量。我们在哥伦比亚 Magdalena Medio 地区收集的新相机陷阱数据集上展示了 WildMatch 的性能。
引用
@article{arxiv.2311.01064,
title = {Multimodal Foundation Models for Zero-shot Animal Species Recognition in Camera Trap Images},
author = {Zalan Fabian and Zhongqi Miao and Chunyuan Li and Yuanhan Zhang and Ziwei Liu and Andrés Hernández and Andrés Montes-Rojas and Rafael Escucha and Laura Siabatto and Andrés Link and Pablo Arbeláez and Rahul Dodhia and Juan Lavista Ferres},
journal= {arXiv preprint arXiv:2311.01064},
year = {2023}
}
备注
18 pages, 9 figures