Mix3R:混合 feed-forward 重建与生成 3D 先验用于联合多视角对齐 3D 重建与姿态估计
计算机视觉与模式识别
2026-05-06 v1
摘要
最近的稀疏视角 3D 重建呈现出两种不同路径:一种是 feed-forward 重建预测像素对齐点图而无完整几何,另一种是生成 3D 重建生成完整几何但往往输入对齐性差。我们提出了 Mix3R,一种新型生成 3D 重建方法,将 feed-forward 重建和 3D 生成混合为单一框架以对齐方式整合。Mix3R 在两个阶段生成 3D 形状:稀疏体素生成阶段和带纹理的几何生成阶段。不同于纯生成方法,我们的第一阶段生成同时产生粗糙 3D 结构(稀疏体素)、每个视角的点图和与该 3D 结构对齐的相机参数。这一设计通过引入 Mixture-of-Transformers 架构,将全局自注意力插入 feed-forward 重建模型和 3D 生成模型中,两者均在大规模数据上预训练。此设计有效保留了预训练先验,却实现了更好的 2D-3D 对齐。基于稀疏 3D 体素和点图的初始对齐生成,我们计算基于重叠的注意力偏置,直接添加到另一个预训练的带纹理几何生成模型中,使其在 training-free manner 正确地将输入纹理放置在生成的形状上。我们的设计为 feed-forward 分支和 3D 生成分支带来了相互益处:feed-forward 分支学习将其预测 grounding 到生成 3D 先验,反之,3D 生成分支受 feed-forward 分支中几何信息丰富的特征条件。结果,我们的方法产生的 3D 形状在输入对齐方面优于纯 3D 生成方法,同时相较于以前的 feed-forward 重建方法,相机姿态估计更准确。我们的项目页面位于 https://jsnln.github.io/mix3r/
引用
@article{arxiv.2605.03359,
title = {Mix3R: Mixing Feed-forward Reconstruction and Generative 3D Priors for Joint Multi-view Aligned 3D Reconstruction and Pose Estimation},
author = {Siyou Lin and Zhou Xue and Hongwen Zhang and Liang An and Dongping Li and Shaohui Jiao and Yebin Liu},
journal= {arXiv preprint arXiv:2605.03359},
year = {2026}
}