VoxHammer:原生 3D 空间中无需训练的精确且连贯的 3D 编辑
计算机视觉与模式识别
2025-08-27 v1
摘要
对指定区域进行 3D 局部编辑对于游戏产业和机器人交互至关重要。近期方法通常编辑渲染的多视角图像,然后重建 3D 模型,但它们在精确保持未编辑区域和整体连贯性方面面临挑战。受结构化 3D 生成模型的启发,我们提出了 VoxHammer,一种在 3D 潜在空间中进行精确且连贯编辑的新型免训练方法。给定一个 3D 模型,VoxHammer 首先预测其反演轨迹,并在每个时间步获得其反演潜在变量和键值令牌。随后,在去噪和编辑阶段,我们将保留区域的去噪特征替换为对应的反演潜在变量和缓存的键值令牌。通过保留这些上下文特征,该方法确保了保留区域的一致重建和编辑部分的连贯集成。为了评估保留区域的一致性,我们构建了 Edit3D-Bench,这是一个包含数百个样本的人工标注数据集,每个样本都仔细标记了 3D 编辑区域。实验表明,VoxHammer 在保留区域的 3D 一致性和整体质量方面均显著优于现有方法。我们的方法有望合成高质量的编辑配对数据,从而为上下文 3D 生成奠定数据基础。请参阅我们的项目页面:https://huanngzh.github.io/VoxHammer-Page/。
引用
@article{arxiv.2508.19247,
title = {VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space},
author = {Lin Li and Zehuan Huang and Haoran Feng and Gengxiong Zhuang and Rui Chen and Chunchao Guo and Lu Sheng},
journal= {arXiv preprint arXiv:2508.19247},
year = {2025}
}
备注
Project page: https://huanngzh.github.io/VoxHammer-Page/