中文

SirenPose: 基于几何监督的动态场景重建

计算机视觉与模式识别 2025-12-24 v1

摘要

我们提出SirenPose,一种几何感知损失函数,将正弦表示网络的周期激活特性与关键点基于几何监督相结合,实现对单目视频中动态3D场景的准确且时序一致的重建。现有方法在面对快速运动、多目标相互作用、遮挡和快速场景变化等挑战性场景时,常常难以保证运动保真度和时空一致性。SirenPose采用受物理启发的约束,在时空维度上强制关键点预测的一致性,同时利用高频信号建模捕捉细粒度几何细节。我们进一步将UniKPT数据集扩展到60万个标注实例,并集成图神经网络来建模关键点之间的关系和结构相关性。在Sintel、Bonn和DAVIS等基准测试上进行的大量实验表明,SirenPose consistently优于最先进的方法。在DAVIS上,SirenPose相较于MoSCA实现了17.8%的FVD降低、28.7%的FID降低和6.0%的LPIPS提升,同时改进了时序一致性、几何精度、用户评分和运动平滑性。在姿态估计方面,SirenPose相较于Monst3R在更低的绝对轨迹误差下表现更好,并且降低了平移和旋转相对姿态误差,凸显其在处理快速运动、复杂动力学和物理上合理的重建方面的有效性。

关键词

引用

@article{arxiv.2512.20531,
  title  = {SirenPose: Dynamic Scene Reconstruction via Geometric Supervision},
  author = {Kaitong Cai and Jensen Zhang and Jing Yang and Keze Wang},
  journal= {arXiv preprint arXiv:2512.20531},
  year   = {2025}
}

备注

Under submission