H3R:用于通用3D重建的混合多视图对应
计算机视觉与模式识别
2025-08-06 v1
摘要
尽管近期在前馈式3D高斯溅射方面取得了进展,但通用3D重建仍然在多视图对应建模方面存在挑战。现有方法面临根本性权衡:显式方法实现几何精确但在歧义区域难以处理,而隐式方法提供鲁棒性但收敛速度较慢。我们提出H3R,一种混合框架,通过整合体积潜在融合和基于注意力的特征聚合来解决这一限制。我们的框架由两个互补组件构成:一个高效潜在体积通过极线约束强制几何一致性,以及一种基于相机的Transformer利用普鲁克坐标进行自适应对应细化。通过整合两种范式,我们的方法在增强泛化能力的同时,收敛速度比现有方法快2倍。此外,我们表明空间对齐的基础模型(如SD-VAE)在语义对齐模型(如DINOv2)之上显著优于语义对齐模型,解决了语义表示与空间重建要求之间的不匹配。我们的方法支持可变数量和高分辨率输入视图,并显示出稳健的跨数据集泛化能力。广泛的实验表明,我们的方法在多个基准测试中实现了最佳性能,在RealEstate10K、ACID和DTU数据集上分别实现了PSNR提升0.59 dB、1.06 dB和0.22 dB。代码可在https://github.com/JiaHeng-DLUT/H3R获取。
关键词
引用
@article{arxiv.2508.03118,
title = {H3R: Hybrid Multi-view Correspondence for Generalizable 3D Reconstruction},
author = {Heng Jia and Linchao Zhu and Na Zhao},
journal= {arXiv preprint arXiv:2508.03118},
year = {2025}
}
备注
ICCV 2025