PIS3R:基于深度 3D 重建的超大视差图像拼接
计算机视觉与模式识别
2025-12-25 v3
摘要
图像拼接旨在将两个来自不同视角的图像对齐为一幅连续、更宽的图像。然而,当 3D 场景包含深度变化且摄像机基线显著时,注意到显著的视差问题——即场景元素在不同视图中的相对位置有显著差异。大多数现有拼接方法难以有效处理此类大视差图像。为此,本文提出一种基于深度 3D 重建的图像拼接解决方案 PIS3R,具备对超大视差的鲁棒性。首先,我们应用基于视几何的变换器处理两个视差极大的输入图像,以获得场景的内参数、外参数以及稠密 3D 场景重建。随后,我们将重建的稠密点云通过恢复的相机参数投影到指定的参考视图,实现像素级对齐并生成初始拼接图像。最后,为进一步解决初始拼接中可能出现的洞或噪声问题,我们提出了基于点条件图像扩散模块以获得精炼结果。与现有方法相比,我们的方案对超大视差更为宽容,并且提供的结果在 3D 光测量语境下完全保留所有像素的几何完整性,可直接应用于下游 3D 视觉任务如 SfM。实验结果表明,所提算法为具有超大视差的图像提供了准确的拼接结果,优于现有方法在定性和定量方面均表现更佳。
引用
@article{arxiv.2508.04236,
title = {PIS3R: Very Large Parallax Image Stitching via Deep 3D Reconstruction},
author = {Muhua Zhu and Xinhao Jin and Chengbo Wang and Yongcong Zhang and Yifei Xue and Tie Ji and Yizhen Lao},
journal= {arXiv preprint arXiv:2508.04236},
year = {2025}
}