中文

4D 同步场:基于运动-语言高斯溅射的时序场景理解

计算机视觉与模式识别 2026-03-17 v1 人工智能 图形学

摘要

当前 4D 表示方法将几何、运动和语义解耦:重建方法丢弃可解释的运动结构;语言 grounding 方法在运动学习后附加语义,忽视对象如何运动;而运动感知方法将动力学编码为不透明的 per-point 残差,缺乏对象级组织。我们提出 4D 同步场,一种 4D 高斯表示方法,在重建过程中通过对象分解运动实现内联学习,并通过每个对象条件化场同步语言。每个高斯轨迹分解为共享对象运动加上隐式残差,运动条件化的岭图预测时间语义变化,形成单一表示,使重建、运动和语义结构耦合,支持从单一训练表示中检索对象和时刻的开放词汇时序查询。在 HyperNeRF 上,4D 同步场实现 28.52 dB 的平均 PSNR,稍居所有语言 grounding 和运动感知基线之首,仅低于重建-only 方法 1.5 dB。在针对性时序状态检索方面,运动条件化场实现 0.884 的平均准确率、0.815 的平均 vIoU 和 0.733 的平均 tIoU,显著优于 4D LangSplat(0.620、0.433、0.439)和 LangSplat(0.415、0.304、0.262)。消融实验确认,运动条件化是主要驱动因素,仅使用静态嵌入基线即可实现 +0.45 tIoU。4D 同步场是唯一一种从单一训练表示中同时暴露可解释运动原语和时序语言场的方法。代码将公开。

关键词

引用

@article{arxiv.2603.14301,
  title  = {4D Synchronized Fields: Motion-Language Gaussian Splatting for Temporal Scene Understanding},
  author = {Mohamed Rayan Barhdadi and Samir Abdaljalil and Rasul Khanbayov and Erchin Serpedin and Hasan Kurban},
  journal= {arXiv preprint arXiv:2603.14301},
  year   = {2026}
}

备注

34 pages, 3 figures, 7 tables. Includes supplementary material. Preprint