中文

CATALOG:基于语言引导的摄像陷阱对比学习模型

计算机视觉与模式识别 2024-12-17 v1 机器学习

摘要

基础模型(Foundation Models, FMs)在图像分类、目标检测和图像分割等计算机视觉任务中取得了显著的成功。然而,当这些模型在与训练数据分布不同的数据集上进行测试时,这些任务仍然具有挑战性,称为领域迁移(domain shift)问题。这在尤其影响针对摄像陷阱图像中动物物种识别时尤为突出,因为要素如光照、伪装和遮挡都会导致变异性。在本文中,我们提出了一种称为 CATALOG(Camera Trap Language-guided Contrastive Learning)的摄像陷阱语言引导对比学习模型,以解决上述问题。我们的 метод结合了多个基础模型,从摄像陷阱数据中提取视觉和文本特征,并使用对比损失函数进行训练。我们在两个基准数据集上对 CATALOG 进行评估,结果表明它在摄像陷阱图像识别中超越了以往的最先进方法,尤其是在训练和测试数据的动物物种不同或来自不同地理区域时效果更为突出。我们的 方法展示了利用基础模型结合多模态融合和对比学习以解决摄像陷阱图像识别中领域迁移问题的潜力。CATALOG 的代码已公开发布于 https://github.com/Julian075/CATALOG。

关键词

引用

@article{arxiv.2412.10624,
  title  = {CATALOG: A Camera Trap Language-guided Contrastive Learning Model},
  author = {Julian D. Santamaria and Claudia Isaza and Jhony H. Giraldo},
  journal= {arXiv preprint arXiv:2412.10624},
  year   = {2024}
}