中文

复兴上下文:将相机陷阱物种分类作为多模态知识图谱上的链接预测

计算机视觉与模式识别 2024-08-27 v5 人工智能

摘要

相机陷阱是动物生态学中用于生物多样性监测和保护的重要工具。然而,其实际应用受到诸如对新地点和未见地点泛化能力差等问题的限制。图像通常与存在于不同模态中的多种形式的上下文相关联。在本工作中,我们利用与相机陷阱图像相关联的结构化上下文,以提升相机陷阱物种分类任务的分布外泛化能力。例如,野生动物的图片可以链接到其拍摄的时间和地点细节,以及关于该动物物种的结构化生物学知识。尽管现有研究往往忽视这一点,但融入此类上下文为更好地理解图像提供了若干潜在益处,例如解决数据稀缺问题和增强泛化能力。然而,如何有效地将此类异构上下文融入视觉领域是一个具有挑战性的问题。为此,我们提出了一种新颖的框架,将物种分类转化为多模态知识图谱(KG)中的链接预测。该框架实现了多样化多模态上下文与视觉识别的无缝集成。我们将此框架应用于 iWildCam2020-WILDS 和 Snapshot Mountain Zebra 数据集上的分布外物种分类,并取得了与最先进方法相当的绩效。此外,我们的框架提高了识别代表性不足物种的样本效率。

关键词

引用

@article{arxiv.2401.00608,
  title  = {Reviving the Context: Camera Trap Species Classification as Link Prediction on Multimodal Knowledge Graphs},
  author = {Vardaan Pahuja and Weidi Luo and Yu Gu and Cheng-Hao Tu and Hong-You Chen and Tanya Berger-Wolf and Charles Stewart and Song Gao and Wei-Lun Chao and Yu Su},
  journal= {arXiv preprint arXiv:2401.00608},
  year   = {2024}
}

备注

12 pages, 5 figures