中文

Motion4D: 学习用于4D场景理解的3D一致运动与语义

计算机视觉与模式识别 2025-12-04 v1

摘要

二维视觉基础模型的最新进展显著提升了从单目视频分析动态场景的能力。然而,尽管这些模型具有强大的泛化能力,它们往往缺乏3D一致性——这是理解场景几何与运动的基本要求,从而导致复杂3D环境中的严重空间错位和时间闪烁。本文提出Motion4D,一个通过将基础模型的2D先验集成到统一4D高斯溅射表示中来应对这些挑战的新框架。我们的方法采用两部分迭代优化框架:1) 序贯优化,在连续阶段中更新运动场与语义场以保持局部一致性;2) 全局优化,联合精炼所有属性以实现长期一致性。为提升运动精度,我们引入3D置信图以动态调整运动先验,并采用自适应重采样过程基于逐像素RGB与语义误差在表示不足的区域插入新的高斯分量。此外,我们通过迭代精炼过程增强语义一致性,交替优化语义场并更新SAM2的提示以解决语义不一致问题。大量评估表明,Motion4D在点基跟踪、视频目标分割和新视角合成等多种场景理解任务中,显著优于二维基础模型和现有三维方法。我们的代码可在 https://hrzhou2.github.io/motion4d-web/ 获取。

关键词

引用

@article{arxiv.2512.03601,
  title  = {Motion4D: Learning 3D-Consistent Motion and Semantics for 4D Scene Understanding},
  author = {Haoran Zhou and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2512.03601},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025