中文

面向指令的原生3D编辑全注意力机制

计算机视觉与模式识别 2025-11-24 v1 图形学

摘要

以指令为导向的3D编辑是 rapidly 发展的领域,具有拓宽3D内容创建访问的潜力。然而,现有方法面临关键局限:优化方法计算耗时,而依赖多视角2D编辑的 feed-forward方法常因几何不一致和视觉质量下降而受限。为此,我们提出一种 novel 的 native 3D编辑框架,直接在单次高效 feed-forward pass中操作3D表示。具体而言,我们构建了一个大规模多模态数据集,用于指令导向的3D编辑,涵盖多样的增、删、改任务。该数据集精心策划,确保编辑后的对象忠实遵循指令变更,同时保持未编辑区域与源对象的一致性。基于该数据集,我们探索了两种不同的条件策略:一种是传统的cross-attention机制,另一种是一种 novel 的3D token拼接方法。我们的结果表明,token拼接更具参数效率,实现了卓越的性能。广泛的评估显示,我们的方法优于现有的2D提升方法,在生成质量、3D一致性和指令忠诚度方面均达到新的基准。

关键词

引用

@article{arxiv.2511.17501,
  title  = {Native 3D Editing with Full Attention},
  author = {Weiwei Cai and Shuangkang Fang and Weicai Ye and Xin Dong and Yunhan Yang and Xuanyang Zhang and Wei Cheng and Yanpei Cao and Gang Yu and Tao Chen},
  journal= {arXiv preprint arXiv:2511.17501},
  year   = {2025}
}