中文

从动态第三人称视频重建静态场景

计算机视觉与模式识别 2026-03-25 v1 图形学

摘要

第三人称视频 presents 独特的挑战,因为相机运动快速且频繁的动态交互。当前的静态重建系统,如 MapAnything,常在这些设置下性能下降,受到严重的轨迹漂移和由移动手部造成的"幽灵"几何的影响。我们通过提出一种稳健的管线来弥合这一差距,该管线适应长时间段的第三人称视频。我们的ethods 引入一种掩码感知的重建机制,显式抑制注意力层中的动态前景,防止手部痕迹污染静态地图。此外,我们采用带有姿态图拼接的块状重建策略,以确保全局一致性并消除长期漂移。在 HD-EPIC 和室内无人机数据集上的实验表明,我们的管线显著改进了绝对轨迹误差,并产生视觉上干净的静态几何,有效地将基础模型的能力扩展到动态第一人称场景。

关键词

引用

@article{arxiv.2603.22450,
  title  = {Static Scene Reconstruction from Dynamic Egocentric Videos},
  author = {Qifei Cui and Patrick Chen},
  journal= {arXiv preprint arXiv:2603.22450},
  year   = {2026}
}