中文

前馈3D编辑从语义部件变换中学习

计算机视觉与模式识别 2026-05-28 v2

摘要

3D编辑是可扩展3D内容创作的基本能力。虽然图像编辑已迅速向大规模前馈生成范式发展,但3D AI生成仍主要由免训练编辑流程主导。前馈3D编辑的一个核心挑战在于缺乏高质量的配对监督。可编辑的3D资产需要同时保持几何结构、多视图一致性、结构连贯性和局部编辑可控性。现有的3D编辑数据集通常依赖于独立生成的资产、图像介导的重建或狭窄的编辑分类,导致定位不准确、保持性弱、编辑边界模糊以及语义一致性有限。在这项工作中,我们引入了一个新的视角:可扩展的前馈3D编辑应该从语义部件变换中学习。基于这一见解,我们提出了Pxform,一个高质量的3D编辑数据集,包含超过10万个跨七种编辑类型的一致编辑前后配对。我们的流程不是将对象视为非结构化形状,而是将编辑直接锚定在语义3D部件上。基于Pxform,我们进一步提出了PartFlow,一个前馈3D编辑网络,它将源感知的潜在控制注入到预训练的3D生成先验中。PartFlow引入了掩码感知的速度保持和渲染空间一致性监督,以共同提高编辑保真度和源保持性,同时在推理期间不需要3D编辑掩码。大量实验表明,高质量的语义部件监督显著改善了可扩展的3D编辑,使PartFlow在几何和外观编辑基准测试中均达到了最先进的性能。

关键词

引用

@article{arxiv.2605.27351,
  title  = {Feedforward 3D Editing Learns from Semantic-Part Transformation},
  author = {Jiawei Weng and Saining Zhang and Zhenxin Diao and Peishuo Li and Henghaofan Zhang and Junhao Chen and Hao Zhao},
  journal= {arXiv preprint arXiv:2605.27351},
  year   = {2026}
}

备注

31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/