中文

Dynamic-eDiTor:基于多模态扩散Transformer的无训练文本驱动4D场景编辑

计算机视觉与模式识别 2025-12-02 v1 人工智能

摘要

近期在4D表示方面的进展,如Dynamic NeRF和4D高斯溅射 (4DGS),已实现动态4D场景重建。然而,由于在编辑期间需同时确保跨视图和时间上的一致性(跨空间和时间),文本驱动4D场景编辑仍鲜有探索。现有研究依赖独立编辑帧的2D扩散模型,常导致运动失真、几何漂移和不完整编辑。我们引入Dynamic-eDiTor,一个基于多模态扩散Transformer (MM-DiT) 和4DGS的无训练文本驱动4D编辑框架。该机制包括用于局部跨视图和时间融合的时空子网格注意力 (STGA),以及用于全局传播的上下文token传递 (CTP),通过token继承和光流引导的token替换实现。这些组件共同使Dynamic-eDiTor能够在无需额外训练的情况下实现无缝、全球一致的多视图视频,直接优化预训练的4DGS。在多视图视频数据集DyNeRF上的大量实验表明,我们的方法在编辑保真度方面优于现有方法,同时实现了更好的跨视图和时间一致性。项目页面可见结果和代码:https://di-lee.github.io/dynamic-eDiTor/

关键词

引用

@article{arxiv.2512.00677,
  title  = {Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer},
  author = {Dong In Lee and Hyungjun Doh and Seunggeun Chi and Runlin Duan and Sangpil Kim and Karthik Ramani},
  journal= {arXiv preprint arXiv:2512.00677},
  year   = {2025}
}

备注

4D Scene Editing