中文

ShapeUP:面向图像条件的可扩展3D编辑

计算机视觉与模式识别 2026-04-28 v2 图形学

摘要

近期在3D基础模型方面的进展使得能够生成高保真资产,但精确的3D操作仍是一个重大挑战。现有的3D编辑框架常常在视觉可控性、几何一致性和可扩展性之间面临困难的权衡。具体而言,基于优化的方法计算效率极低,多视图2D传播技术容易出现视觉漂移,而训练自由的潜在操控方法则受限于冻结的先验,无法从扩放中获益。在本工作中,我们提出了ShapeUP,一个可扩展、面向图像条件的3D编辑框架,将编辑形式化为native 3D表示中的监督式潜到潜转换。这种表述使ShapeUP能够建立在预训练的3D基础模型之上,利用其强大的生成先验,同时通过监督训练使其适应编辑。在实际中,ShapeUP 基于由源3D形状、编辑后的2D图像以及相应的编辑后3D形状组成的三元组进行训练,使用3D扩散Transformer(DiT)学习直接的映射。这种以图像作为提示的方法使我们能够对局部和全局编辑实现细粒度的视觉控制,同时实现隐式、无掩码的定位,并保持与原始资产的严格结构一致性。我们的广泛评估表明,ShapeUP 在身份保持和编辑保真度方面 consistently 优于当前训练的和训练自由的基线,为native 3D内容创建提供了稳健且可扩展的范式。

关键词

引用

@article{arxiv.2602.05676,
  title  = {ShapeUP: Scalable Image-Conditioned 3D Editing},
  author = {Inbar Gat and Dana Cohen-Bar and Guy Levy and Elad Richardson and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2602.05676},
  year   = {2026}
}

备注

SIGGRAPH 2026. Project page: https://inbar-2344.github.io/ShapeUp-page/