从动态第三人称视频重建静态场景
计算机视觉与模式识别
2026-03-25 v1 图形学
摘要
第三人称视频 presents 独特的挑战,因为相机运动快速且频繁的动态交互。当前的静态重建系统,如 MapAnything,常在这些设置下性能下降,受到严重的轨迹漂移和由移动手部造成的"幽灵"几何的影响。我们通过提出一种稳健的管线来弥合这一差距,该管线适应长时间段的第三人称视频。我们的ethods 引入一种掩码感知的重建机制,显式抑制注意力层中的动态前景,防止手部痕迹污染静态地图。此外,我们采用带有姿态图拼接的块状重建策略,以确保全局一致性并消除长期漂移。在 HD-EPIC 和室内无人机数据集上的实验表明,我们的管线显著改进了绝对轨迹误差,并产生视觉上干净的静态几何,有效地将基础模型的能力扩展到动态第一人称场景。
引用
@article{arxiv.2603.22450,
title = {Static Scene Reconstruction from Dynamic Egocentric Videos},
author = {Qifei Cui and Patrick Chen},
journal= {arXiv preprint arXiv:2603.22450},
year = {2026}
}