中文

野生动物环境单目度量深度估计基准

计算机视觉与模式识别 2025-10-07 v1

摘要

相机陷阱广泛用于野生动物监测,但从单目图像中提取准确距离测量仍具有挑战性 due to 深度信息的缺失。尽管单目深度估计 (MDE) 方法在 recent years 取得了显著进展,但其在自然野生动物环境中的性能尚未系统评估。本工作引入野生动物监测条件下单目度量深度估计的第一个基准测试。我们在 93 张相机陷阱图像上评估了四种最先进的 MDE 方法 (Depth Anything V2、ML Depth Pro、ZoeDepth 和 Metric3D),以及几何基线方法。我们的结果表明,Depth Anything V2 在整体性能方面最佳,平均绝对误差为 0.454m,相关性为 0.962,而像 ZoeDepth 这样的方法在户外自然环境中表现显著下降(MAE: 3.087m)。我们发现,基于中位数的深度提取在所有深度学习方法中始终优于基于均值的方法。此外,我们分析了计算效率,ZoeDepth 最快(每图像 0.17 秒),但最不准确;而 Depth Anything V2 在准确性和速度之间提供了最佳平衡(每图像 0.22 秒)。该基准确立了野生动物应用的性能基准,并为在保育监测系统中实现深度估计提供了实用指导。

关键词

引用

@article{arxiv.2510.04723,
  title  = {Benchmark on Monocular Metric Depth Estimation in Wildlife Setting},
  author = {Niccolò Niccoli and Lorenzo Seidenari and Ilaria Greco and Francesco Rovero},
  journal= {arXiv preprint arXiv:2510.04723},
  year   = {2025}
}