ShapeR:基于日常采集的鲁棒条件式 3D 形状生成
计算机视觉与模式识别
2026-01-19 v1 机器学习
摘要
3D 形状生成的最新进展取得了令人瞩目的成果,但大多数现有方法依赖于干净、无遮挡且分割良好的输入。此类条件在真实世界场景中很少能满足。我们提出了 ShapeR,一种从日常采集的序列中进行条件式 3D 物体形状生成的新方法。给定一个图像序列,我们利用现成的视觉惯性 SLAM、3D 检测算法和视觉语言模型,为每个物体提取一组稀疏 SLAM 点、带位姿的多视图图像和机器生成的字幕。随后,一个经过训练以有效利用这些模态作为条件的校正流 Transformer 会生成高保真度的公制 3D 形状。为了确保对日常采集数据挑战的鲁棒性,我们采用了一系列技术,包括即时组合增强、跨越物体级和场景级数据集的课程训练方案,以及处理背景杂乱的策略。此外,我们引入了一个新的评估基准,包含跨 7 个真实世界场景的 178 个带有几何标注的野外物体。实验表明,ShapeR 在这一具有挑战性的设置中显著优于现有方法,与 SOTA 相比,Chamfer 距离实现了 2.7 倍的提升。
引用
@article{arxiv.2601.11514,
title = {ShapeR: Robust Conditional 3D Shape Generation from Casual Captures},
author = {Yawar Siddiqui and Duncan Frost and Samir Aroudj and Armen Avetisyan and Henry Howard-Jenkins and Daniel DeTone and Pierre Moulon and Qirui Wu and Zhengqin Li and Julian Straub and Richard Newcombe and Jakob Engel},
journal= {arXiv preprint arXiv:2601.11514},
year = {2026}
}
备注
Project Page: http://facebookresearch.github.io/ShapeR Video: https://www.youtube.com/watch?v=EbY30KAA55I