中文

上下文增强立体变换器

计算机视觉与模式识别 2022-10-24 v1 人工智能

摘要

立体深度估计是计算机视觉研究的热点。然而,现有方法难以泛化,并在危险区域(如大面积均匀区域)中可靠预测。为克服这些局限,我们提出上下文增强路径(CEP)。CEP 通过捕获长程全局信息,提升了现有方案在常见失败情形下的泛化能力与鲁棒性。我们将 CEP 插入最先进的立体深度估计方法 Stereo Transformer,构建了立体深度估计模型——上下文增强立体变换器(CSTR)。CSTR 在多个公开数据集上进行了验证,如 Scene Flow、Middlebury-2014、KITTI-2015 与 MPI-Sintel。我们发现 CSTR 大幅优于先前方法。例如,在零样本合成到真实的设定下,CSTR 在 Middlebury-2014 数据集上比最佳竞争方法高出 11%。我们的大量实验表明,长程信息对立体匹配任务至关重要,且 CEP 成功捕获了此类信息。

关键词

引用

@article{arxiv.2210.11719,
  title  = {Context-Enhanced Stereo Transformer},
  author = {Weiyu Guo and Zhaoshuo Li and Yongkui Yang and Zheng Wang and Russell H. Taylor and Mathias Unberath and Alan Yuille and Yingwei Li},
  journal= {arXiv preprint arXiv:2210.11719},
  year   = {2022}
}

备注

Accepted by ECCV2022