中文

面向上下文丰富的自动生物多样性评估:从相机陷阱数据中派生 AI 驱动洞察

计算机视觉与模式识别 2024-11-22 v1 人工智能

摘要

相机陷阱为生态研究提供了巨大的新机遇,但当前的自动化图像分析方法往往缺乏所需的上下文丰富性,以支持具有影响力的保育成果。我们 presented 一个集成方法,将深度学习的视觉和语言模型结合起来,用于改进使用相机陷阱数据的生态报告。我们引入了一个两阶段系统:YOLOv10-X 用于在图像中定位和分类物种(哺乳动物和鸟类),以及 Phi-3.5-vision-instruct 模型用于读取 YOLOv10-X 的边界框标签以识别物种,克服其在难以分类图像对象的局限性。此外,Phi-3.5 检测更广泛的变量,如植被类型和白天/夜晚时间,为 YOLO 的物种检测输出提供丰富的生态和环境背景。当将这些输出与模型的自然语言系统结合时,输出被处理以回答复杂查询,并采用检索增强生成(RAG)来丰富响应,添加外部信息,如物种重量和 IUCN 状况(这些信息无法通过直接视觉分析获得)。该信息用于自动生成结构化报告,为生物多样性利益相关者提供关于物种丰度、分布、动物行为和栖息地选择的深入见解。我们的做法提供了丰富的叙事,助力野生动物管理决策。通过提供丰富的上下文见解,我们的做法不仅减少了人工工作,还支持及时决策,可能将保育努力从反应性转向预防性。

关键词

引用

@article{arxiv.2411.14219,
  title  = {Towards Context-Rich Automated Biodiversity Assessments: Deriving AI-Powered Insights from Camera Trap Data},
  author = {Paul Fergus and Carl Chalmers and Naomi Matthews and Stuart Nixon and Andre Burger and Oliver Hartley and Chris Sutherland and Xavier Lambin and Steven Longmore and Serge Wich},
  journal= {arXiv preprint arXiv:2411.14219},
  year   = {2024}
}

备注

32 Pages, 22 images