中文

WildDepth:用于三维野生动物感知与深度估计的多模态数据集

计算机视觉与模式识别 2026-03-30 v2 数字图书馆

摘要

深度估计和三维重建已被广泛研究为计算机视觉的核心课题。从具有相对简单几何形状的刚性物体(如车辆)开始,研究已扩展到处理通用物体,包括具有挑战性的可变形物体,如人类和动物。然而,特别是对于动物,大多数现有模型基于无度量尺度的数据集进行训练,这有助于验证纯图像模型。为解决这一局限,我们提出了 WildDepth,一个面向深度估计、行为检测和三维重建的多模态数据集和基准套件,涵盖从家养到野生环境中的多种动物类别,并配有同步的 RGB 和 LiDAR 数据。实验结果表明,多模态数据的使用将深度可靠性提升了最高 10% 的 RMSE,而 RGB-LiDAR 融合将三维重建保真度在 Chamfer 距离上提升了 12%。通过发布 WildDepth 及其基准,我们旨在促进跨领域泛化的鲁棒多模态感知系统。

关键词

引用

@article{arxiv.2603.16816,
  title  = {WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation},
  author = {Muhammad Aamir and Naoya Muramatsu and Sangyun Shin and Matthew Wijers and Jia-Xing Zhong and Xinyu Hou and Amir Patel and Andrew Loveridge and Andrew Markham},
  journal= {arXiv preprint arXiv:2603.16816},
  year   = {2026}
}