突破体素限制的 3D 编辑:基于 3D 掩码与自构建数据的学习
计算机视觉与模式识别
2026-04-16 v1 人工智能
摘要
3D 编辑指的是对 3D 资产应用局部或全局修改的能力。有效的 3D 编辑需要通过根据提示执行局部更改来保持语义一致性,同时保持局部不变性,以确保未更改的区域与原始内容保持一致。然而,现有方法存在显著局限性:多视角编辑方法在投影回 3D 时会出现损失,而基于体素的编辑则受限于可修改的区域和修改规模。此外,缺乏足够大的编辑数据集用于训练和评估也是一个挑战。为此,我们提出了基于 3D 掩码和自构建数据集的超越体素 3D 编辑(Beyond Voxel 3D Editing, BVE)框架。基于该数据集,我们的模型通过轻量级可训练模块来增强基础的图像到 3D 生成架构,实现对文本语义的高效注入,而无需进行高昂的完整模型重新训练。进一步,我们引入一种无标注的 3D 掩码策略以保持局部不变性,在编辑期间保持未更改区域的完整性。大量实验表明,BVE 在生成高质量、文本对齐的 3D 资产方面性能卓越,同时忠实地保留了原始输入的视觉特征。
引用
@article{arxiv.2604.13688,
title = {Beyond Voxel 3D Editing: Learning from 3D Masks and Self-Constructed Data},
author = {Yizhao Xu and Hongyuan Zhu and Caiyun Liu and Tianfu Wang and Keyu Chen and Sicheng Xu and Jiaolong Yang and Nicholas Jing Yuan and Qi Zhang},
journal= {arXiv preprint arXiv:2604.13688},
year = {2026}
}