中文

面向可扩展且一致的 3D 编辑

计算机视觉与模式识别 2025-10-06 v1

摘要

3D 编辑——即对 3D 资产的几何或外观进行局部修改的任务——在沉浸式内容创建、数字娱乐和 AR/VR 领域具有广泛应用前景。然而,与 2D 编辑相比,它仍面临跨视角一致性、结构保真度和细粒度可控性等挑战。现有方法往往速度较慢、易产生几何畸变,或依赖手动且精确的 3D 掩码,这些掩码容易出错且不够实用。为此,我们在数据和模型两个层面进行突破。数据方面,我们引入 3DEditVerse,这是目前规模最大的成对 3D 编辑基准数据集,包含 116,309 个高质量训练对和 1,500 个精选测试对。通过姿态驱动的几何编辑和基础模型引导的外观编辑的互补管道构建,3DEditVerse 确保编辑的局部性、多视角一致性和语义对齐。模型方面,我们提出 3DEditFormer,即一种 3D 结构保持的条件转换器。通过增强图像到 3D 生成的双导向注意力和时间自适应门控,3DEditFormer 能够将可编辑区域与被保留结构解耦,实现无需额外 3D 掩码的精确且一致的编辑。大量实验表明,我们的框架在定量和定性方面均优于最先进的基线方法,为实际可扩展的 3D 编辑树立了新标准。数据集和代码将对外公开。项目:https://www.lv-lab.org/3DEditFormer/

关键词

引用

@article{arxiv.2510.02994,
  title  = {Towards Scalable and Consistent 3D Editing},
  author = {Ruihao Xia and Yang Tang and Pan Zhou},
  journal= {arXiv preprint arXiv:2510.02994},
  year   = {2025}
}