中文

用于可解释单目高度估计的解耦隐空间 Transformer

计算机视觉与模式识别 2022-02-03 v2

摘要

从遥感影像进行单目高度估计(MHE)在高效生成三维城市模型以快速响应自然灾害方面具有很高潜力。大多数现有工作追求更高性能,但鲜有研究探索 MHE 网络的可解释性。本文旨在探究深度神经网络如何从单张单目图像预测高度。为全面理解 MHE 网络,我们提出从多个层面解释它们:1) 神经元:单元级剖析,探索所学内部深度表示的语义与高度选择性;2) 实例:对象级解释,研究不同语义类别、尺度与空间上下文对高度估计的影响;3) 归因:像素级分析,理解哪些输入像素对高度估计重要。基于多级解释,提出一种解耦隐空间 Transformer 网络,以构建更紧凑、可靠且可解释的深度学习单目高度估计模型。此外,本文首次引入了基于高度估计的新颖无监督语义分割任务。我们还构建了一个用于联合语义分割与高度估计的新数据集。我们的工作为理解与设计 MHE 模型提供了新见解。

关键词

引用

@article{arxiv.2201.06357,
  title  = {Disentangled Latent Transformer for Interpretable Monocular Height Estimation},
  author = {Zhitong Xiong and Sining Chen and Yilei Shi and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2201.06357},
  year   = {2022}
}