高效混合 CNN-GNN 架构用于单目深度估计
计算机视觉与模式识别
2026-05-12 v1
摘要
我们提出 GraphDepth,一种单目深度估计架构,将图神经网络(GNN)与卷积编码器-解码器框架有效集成。我们的方法在 ResNet-101 U-net 主干架构的多个尺度上嵌入高效 GraphSAGE 层,使其能够显式建模超出局部卷积感受野的长程空间关系。关键技术贡献包括:(1)批处理并行化图构建,支持可配置的 k-NN 和网格基邻接以实现可扩展训练;(2)在瓶颈和解码器阶段(1/32、1/16、1/8 分辨率)集成多尺度 GraphSAGE,以在特征层次结构中传播全局上下文;(3)通道注意力门控跳跃连接,自适应地对编码器特征进行加权后进行融合;(4)通过专用不确定性头实现的异质不确定性估计,使优化期间的损失函数能够实现置信感知加权。不同于基于转换器的混合模型,后者在序列长度为二次方的情况下计算复杂度较高,GraphDepth 在空间分辨率上实现线性尺度,同时通过迭代消息传递实现相当的全局感受野。在 NYU Depth V2、WHU Aerial、ETH3D 和 Mid-Air 数据集上的实验表明,GraphDepth 在室内场景下仅落后于最先进转换器约 4.6%,但计算成本显著降低(25 FPS vs 9 FPS,3.8 GB vs 8.8 GB VRAM)。GraphDepth 在 WHU Aerial 数据集上取得最佳报告结果(RMSE 8.24 m),并在中空航拍合成数据集上表现出优异的零样本跨域迁移能力,验证了显式关系推理在深度估计中的泛化能力。
引用
@article{arxiv.2605.10251,
title = {Efficient Hybrid CNN-GNN Architecture for Monocular Depth Estimation},
author = {Ishan Narayan},
journal= {arXiv preprint arXiv:2605.10251},
year = {2026}
}