中文

端到端立体匹配算法是否未充分利用信息?

计算机视觉与模式识别 2020-10-16 v1

摘要

用于立体匹配的深层网络通常利用 2D 或 3D 卷积编码器-解码器架构来聚合代价并正则化代价体,以实现准确的视差估计。由于内容不敏感卷积以及下采样和上采样操作,这些代价聚合机制未能充分利用图像中可用信息。视差图在遮挡边界附近存在过度平滑问题,且在细长结构中出现错误预测。在本文中,我们展示了如何将深度自适应滤波和可微半全局聚合集成到现有 2D 和 3D 卷积网络中以实现端到端立体匹配,从而提升准确性。改进的原因在于利用图像中的 RGB 信息作为动态引导匹配过程的信号,而其本身也是我们在图像间尝试匹配的信号。我们在 KITTI 2015 和 Virtual KITTI 2 数据集上展示了大量实验结果,将四种自适应滤波器(分割感知双边滤波、动态滤波网络、像素自适应卷积和半全局聚合)集成到四种立体网络(DispNetC、GCNet、PSMNet 和 GANet)架构中进行比较。我们的代码可在 https://github.com/ccj5351/DAFStereoNets 获取。

关键词

引用

@article{arxiv.2010.07350,
  title  = {Do End-to-end Stereo Algorithms Under-utilize Information?},
  author = {Changjiang Cai and Philippos Mordohai},
  journal= {arXiv preprint arXiv:2010.07350},
  year   = {2020}
}

备注

13 pages, 10 figures, International Conference on 3D Vision (3DV'2020)