中文

面向实时无人机林业应用的树枝图像深度匹配网络训练:基准研究

计算机视觉与模式识别 2026-02-24 v1 图像与视频处理

摘要

自动化无人机树枝修剪需要从立体相机获取准确的实时深度估计。深度由视差图计算,公式为 Z=fB/dZ = f B/d,因此即使在工作距离下,微小的视差误差也会导致显著的深度误差。基于我们先前确定的 DEFOM-Stereo 对植被场景最佳参考视差生成器,我们present 首个在真实树枝图像上训练和测试十个深度立体匹配网络的研究。我们使用 Canterbury Tree Branches 数据集——来自 ZED Mini 相机的 5,313 对 1080P 和 720P 立体对,采用 DEFOM 生成的视差图作为训练目标。十种方法覆盖分步细化、3D 卷积、边缘感知注意力和轻量级设计。使用感知指标(SSIM、LPIPS、ViTScore)和结构指标(SIFT/ORB 特征匹配),我们发现 BANet-3D 在整体质量方面表现最佳(SSIM = 0.883,LPIPS = 0.157),而 RAFT-Stereo 在场景级理解方面得分最高(ViTScore = 0.799)。在 NVIDIA Jetson Orin Super(16 GB,独立供电)上进行测试显示,AnyNet 能在 1080P 下达到 6.99 FPS——唯一的接近实时选项——而 BANet-2D 在质量-速度平衡方面表现最佳(1.21 FPS)。我们还比较了 720P 和 1080P 的处理时间,以为林业无人机系统的分辨率选择提供指导。

关键词

引用

@article{arxiv.2602.19763,
  title  = {Training Deep Stereo Matching Networks on Tree Branch Imagery: A Benchmark Study for Real-Time UAV Forestry Applications},
  author = {Yida Lin and Bing Xue and Mengjie Zhang and Sam Schofield and Richard Green},
  journal= {arXiv preprint arXiv:2602.19763},
  year   = {2026}
}