上下文增强立体变换器
计算机视觉与模式识别
2022-10-24 v1 人工智能
摘要
立体深度估计是计算机视觉研究的热点。然而,现有方法难以泛化,并在危险区域(如大面积均匀区域)中可靠预测。为克服这些局限,我们提出上下文增强路径(CEP)。CEP 通过捕获长程全局信息,提升了现有方案在常见失败情形下的泛化能力与鲁棒性。我们将 CEP 插入最先进的立体深度估计方法 Stereo Transformer,构建了立体深度估计模型——上下文增强立体变换器(CSTR)。CSTR 在多个公开数据集上进行了验证,如 Scene Flow、Middlebury-2014、KITTI-2015 与 MPI-Sintel。我们发现 CSTR 大幅优于先前方法。例如,在零样本合成到真实的设定下,CSTR 在 Middlebury-2014 数据集上比最佳竞争方法高出 11%。我们的大量实验表明,长程信息对立体匹配任务至关重要,且 CEP 成功捕获了此类信息。
引用
@article{arxiv.2210.11719,
title = {Context-Enhanced Stereo Transformer},
author = {Weiyu Guo and Zhaoshuo Li and Yongkui Yang and Zheng Wang and Russell H. Taylor and Mathias Unberath and Alan Yuille and Yingwei Li},
journal= {arXiv preprint arXiv:2210.11719},
year = {2022}
}
备注
Accepted by ECCV2022