中文

利用大规模社区策展数据集进行多物种动物再识别

计算机视觉与模式识别 2024-12-10 v1

摘要

近期研究已确立了开发从图像中个体识别动物的算法在生态学上的重要性。通常,为每个物种分别训练一个算法,这是一个自然的步骤,但会产生广泛使用的重大障碍:(1)每项工作成本高昂,需要数据收集、数据策展以及模型训练、部署和维护;(2)许多物种缺乏训练数据;(3)物种间外观的共性未被利用。我们提出了一种专注于训练多物种个体识别(再识别)模型的替代方法。我们构建了一个包含49个物种、37K个个体动物和225K张图像的数据集,使用这些数据为所有物种训练一个单一的嵌入网络。我们的模型采用EfficientNetV2骨干网络和具有动态边界的子中心ArcFace损失函数。我们以多种方式评估了该多物种模型的性能。最值得注意的是,我们证明它始终优于分别为每个物种训练的模型,在top-1准确率上实现了平均12.5%的提升。此外,该模型在未见物种上展现出强大的零样本性能和微调能力,可通过向训练集增量添加数据和在不使用原始数据的情况下微调,有效策展新物种。此外,我们的模型在未见物种上超越了近期的MegaDescriptor,平均每个物种top-1提升19.2%,并在所有33个测试物种上均展现出提升。功能完备的代码仓库在GitHub上公开发布,特征提取模型可在HuggingFace上获取,以便与野生动物再识别流程无缝集成。该模型已在大型野生动物监测系统中投入生产使用,覆盖60多个物种。

关键词

引用

@article{arxiv.2412.05602,
  title  = {Multispecies Animal Re-ID Using a Large Community-Curated Dataset},
  author = {Lasha Otarashvili and Tamilselvan Subramanian and Jason Holmberg and J. J. Levenson and Charles V. Stewart},
  journal= {arXiv preprint arXiv:2412.05602},
  year   = {2024}
}