中文

UniTT-Stereo:统一Transformer训练以增强立体匹配

计算机视觉与模式识别 2024-09-05 v1

摘要

与其他视觉任务不同,Transformer方法在立体深度估计中仍然主要由基于卷积的方法占据主导地位。这主要是由于立体匹配的真实世界真值稀缺,限制了基于Transformer的立体方法性能的提升。本文提出UniTT-Stereo,一种最大化基于Transformer立体架构潜力的方法,通过统一用于预训练的自监督学习与基于监督学习的立体匹配框架。具体而言,我们探讨了从局部归纳偏置的角度,重建输入图像中被遮盖部分的特征,同时预测另一图像中对应点的有效性,这在数据有限的训练中至关重要。此外,为了解决重建与预测这两个具有挑战性的任务,我们提出了一种新策略,在训练立体模型时可变更掩码比率。在Various基准测试(包括ETH3D、KITTI 2012和KITTI 2015数据集)上验证了UniTT-Stereo的领先性能。最后,为了探讨所提出方法的优势,我们提供了特征图频率分析,以及基于注意力图的局部归纳偏置分析。

关键词

引用

@article{arxiv.2409.02545,
  title  = {UniTT-Stereo: Unified Training of Transformer for Enhanced Stereo Matching},
  author = {Soomin Kim and Hyesong Choi and Jihye Ahn and Dongbo Min},
  journal= {arXiv preprint arXiv:2409.02545},
  year   = {2024}
}