中文

通过SVDA实现单目深度估计中可解释的视觉Transformer

计算机视觉与模式识别 2026-02-12 v1

摘要

单目深度估计是计算机视觉中的一个核心问题,在机器人、增强现实和自动驾驶中都有应用,然而驱动现代Transformer架构的自注意力机制仍然是不透明的。我们将SVD启发的注意力(SVDA)引入密集预测Transformer (DPT),为密集预测任务提供了第一个谱结构化的注意力公式。SVDA通过将一个可学习的对角矩阵嵌入到归一化的查询-键交互中,将方向对齐与谱调制解耦,从而产生本质上是可解释的注意力图,而不是事后近似。在KITTI和NYU-v2上的实验表明,SVDA在仅增加少量计算开销的同时,保持或略微提高了预测精度。更重要的是,SVDA解锁了六个谱指标,用于量化熵、秩、稀疏性、对齐度、选择性和鲁棒性。这些指标揭示了训练过程中注意力组织方式的跨数据集和深度方向的一致模式,这些洞察在标准Transformer中是无法获得的。通过将注意力的角色从黑箱机制转变为可量化描述符,SVDA重新定义了单目深度估计中的可解释性,并为实现透明的密集预测模型开辟了一条原则性的途径。

关键词

引用

@article{arxiv.2602.11005,
  title  = {Interpretable Vision Transformers in Monocular Depth Estimation via SVDA},
  author = {Vasileios Arampatzakis and George Pavlidis and Nikolaos Mitianoudis and Nikos Papamarkos},
  journal= {arXiv preprint arXiv:2602.11005},
  year   = {2026}
}

备注

8 pages, 2 figures, submitted to CVPR Conference 2026