Director:面向动态场景建模与理解的实例感知高斯溅射
计算机视觉与模式识别
2026-04-03 v1
摘要
体积视频旨在将动态场景建模为具有时序一致性的四维表示。虽然近期的高斯基方法在渲染保真度方面取得令人瞩目的成果,但主要侧重于外观,对实例级结构几乎不关心,这限制了在高度动态场景中实现稳定跟踪和语义推理。本文提出Director,一种统一的时空高斯表示,联合建模人体动作、高保真渲染和实例级语义。我们的关键洞察在于,嵌入实例一致的语义自然地补充四维建模,使场景分解更加准确,同时支持稳健的动态场景理解。为此,我们利用时序对齐的实例掩码和来自多模态大语言模型的句子嵌入,通过两个MLP解码器监督每个高斯的可学习语义特征,实现语言对齐的四维表示并强制时间上的身份一致性。为增强时序稳定性,我们将二维光流与四维高斯关联,并微调其运动,实现可靠的初始化并减少漂移。对于训练,我们进一步引入几何感知的SDF约束,以及促进表面连续性的正则化项,增强动态前景建模的时序一致性。实验表明,Director在实现时序一致的四维重建的同时,同时实现实例分割和开放词汇查询。
引用
@article{arxiv.2604.01678,
title = {Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding},
author = {Yuheng Jiang and Yiwen Cai and Zihao Wang and Yize Wu and Sicheng Li and Zhuo Su and Shaohui Jiao and Lan Xu},
journal= {arXiv preprint arXiv:2604.01678},
year = {2026}
}
备注
Project page: https://caiyw2023.github.io/Director/