Mono4DEditor:通过语言嵌入高斯函数的点级定位实现单目视频驱动的四维场景编辑
计算机视觉与模式识别
2025-10-13 v1
摘要
基于单目视频重建的四维场景根据文本提示进行编辑是一项有价值且具有挑战性的任务,在内容创作和虚拟环境中具有广泛应用。关键难点在于在复杂动态场景的局部区域实现语义精确编辑,同时保持未编辑内容的完整性。为此,我们提出了 Mono4DEditor,一个用于灵活且准确文本驱动四维场景编辑的新框架。我们的方法通过量化 CLIP 特征增强 3D 高斯函数,形成语言嵌入的动态表示,从而实现对任意空间区域的高效语义查询。我们进一步提出了一种两阶段点级定位策略,首先通过 CLIP 相似性选择候选高斯函数,然后细化其空间范围以提高精度。最后,使用基于扩散的视频编辑模型对定位区域进行针对性编辑,通过流和涂鸦引导确保空间保真度和时间一致性。大量实验表明,Mono4DEditor 能够在多样化场景和物体类型中实现高质量的文本驱动编辑,同时保持未编辑区域的外观和几何特征,并在灵活性和视觉保真度方面超越先前方法。
引用
@article{arxiv.2510.09438,
title = {Mono4DEditor: Text-Driven 4D Scene Editing from Monocular Video via Point-Level Localization of Language-Embedded Gaussians},
author = {Jin-Chuan Shi and Chengye Su and Jiajun Wang and Ariel Shamir and Miao Wang},
journal= {arXiv preprint arXiv:2510.09438},
year = {2025}
}
备注
19 pages, 9 figures