中文

基于可感知重建与几何对齐上下文视频遮罩的高保真 3D 场景编辑

计算机视觉与模式识别 2026-04-02 v1

摘要

我们提出TRACE,一种 mesh 引导的 3DGS 编辑框架,实现自动化、高保真的场景转换。通过以显式 3D 几何锚定视频扩散,TRACE 独特地实现了精细的、部件级别的操控——例如局部姿态位移或组件替换——同时保持中心主体的结构完整性,这种能力在现有编辑方法中几乎不存在。我们的方法包含三个关键阶段:(1) 多视角 3D-Anchor Synthesis,利用稀疏视图编辑器训练的我们的数据集——第一个专为场景连贯物体添加和修改而建立的多视角一致数据集——生成空间一致的 3D-anchors;(2) 可感知几何锚定(TGA),通过两阶段配准确保插入网格与 3DGS 场景之间的精确空间同步;(3) 上下文视频遮罩(CVM),将 3D 投影集成到自回归视频管道中,以实现时序稳定、物理驱动的渲染。广泛的实验表明,TRACE 在编辑灵活性和结构完整性方面 consistently 优于现有方法。

关键词

引用

@article{arxiv.2604.01207,
  title  = {TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking},
  author = {Jiyuan Hu and Zechuan Zhang and Zongxin Yang and Yi Yang},
  journal= {arXiv preprint arXiv:2604.01207},
  year   = {2026}
}

备注

22 pages, 9 figures