Fillerbuster:面向随意拍摄的统一生成式场景补全模型
计算机视觉与模式识别
2026-03-18 v2 图形学
摘要
我们提出了 Fillerbuster,这是一个统一的模型,它利用多视图隐式扩散 Transformer 来补全三维场景中的未知区域。日常拍摄通常稀疏,并且会缺失物体背后或场景上方的周围内容。现有方法不适合应对这一挑战,因为它们侧重于利用稀疏视图先验使已知像素看起来更好,或者仅从一两张照片中创建物体的缺失面。实际上,我们通常有数百个输入帧,并希望补全输入帧中缺失和未观察到的区域。我们的解决方案是训练一个生成模型,该模型可以消耗大量输入帧上下文,同时生成未知的目标视图,并在相机参数未知时恢复图像位姿。我们展示了在两个现有数据集上补全部分拍摄的结果。我们还提出了一个未标定的场景补全任务,其中我们的统一模型同时预测位姿并创建新内容。我们将框架开源,以便集成到像 Nerfstudio 或 Gsplat 这样的流行重建平台中。我们提出了一个灵活、统一的修复框架,用于同时预测多张图像和位姿,其中所有输入被联合修复,并且它可以扩展到预测更多模态,如深度。
引用
@article{arxiv.2502.05175,
title = {Fillerbuster: Unified Generative Scene Completion Model for Casual Captures},
author = {Ethan Weber and Norman Müller and Yash Kant and Vasu Agrawal and Michael Zollhöfer and Angjoo Kanazawa and Christian Richardt},
journal= {arXiv preprint arXiv:2502.05175},
year = {2026}
}
备注
Project page at https://ethanweber.me/fillerbuster/