THIRDEYE:基于脑启发多阶段融合的线索感知单目深度估计
计算机视觉与模式识别
2025-06-27 v1 人工智能
摘要
单目深度估计方法传统上训练深度模型直接从 RGB 像素推断深度。这种隐式学习往往忽略了人类视觉系统所依赖的显式单目线索,如遮挡边界、阴影和透视。我们没有期望网络在无辅助的情况下发现这些线索,而是提出了 ThirdEye,一种线索感知的流水线,通过专门的、预训练且冻结的网络刻意提供每种线索。这些线索在一个配备键值工作记忆模块的三阶段皮层层级结构(V1->V2->V3)中融合,该模块根据可靠性对线索进行加权。随后,一个自适应分箱 Transformer 头部生成高分辨率视差图。由于线索专家网络是冻结的,ThirdEye 继承了大量外部监督,同时仅需适度的微调。此扩展版本提供了额外的架构细节、神经科学动机以及扩展的实验方案;定量结果将在未来的修订版中呈现。
引用
@article{arxiv.2506.20877,
title = {THIRDEYE: Cue-Aware Monocular Depth Estimation via Brain-Inspired Multi-Stage Fusion},
author = {Calin Teodor Ioan},
journal= {arXiv preprint arXiv:2506.20877},
year = {2025}
}