中文

ROIFormer:面向高效自监督单目深度估计的语义感知感兴趣区域 Transformer

计算机视觉与模式识别 2023-03-07 v3

摘要

对互利跨领域的探索已在精确自监督深度估计方面展现出巨大潜力。本文中,我们重审深度与语义信息间的特征融合,并提出一种用于几何感知表示增强的高效局部自适应注意力方法。我们并非在无约束下建立全局连接或跨特征空间形变注意力,而是将空间交互限定于可学习的感兴趣区域内。具体而言,我们利用语义信息提供的几何线索学习局部自适应边界框,以引导无监督特征聚合。局部区域将多数不相关参考点排除于注意力空间之外,从而实现更具选择性的特征学习与更快收敛。我们自然地将此范式扩展为多头分层方式,以在不同语义层级实现信息蒸馏,并提升细粒度深度估计的特征判别能力。在 KITTI 数据集上的大量实验表明,我们所提方法在自监督单目深度估计任务中确立了新的 SOTA,证明了本方法相对于先前 Transformer 变体的有效性。

关键词

引用

@article{arxiv.2212.05729,
  title  = {ROIFormer: Semantic-Aware Region of Interest Transformer for Efficient Self-Supervised Monocular Depth Estimation},
  author = {Daitao Xing and Jinglin Shen and Chiuman Ho and Anthony Tzes},
  journal= {arXiv preprint arXiv:2212.05729},
  year   = {2023}
}

备注

Camera Ready for AAAI 2023