中文

层次运动融合:将运动分割提升至 egocentric 视频的三维空间

计算机视觉与模式识别 2025-06-24 v2

摘要

计算机视觉主要基于二维技术,而三维视觉仍局限于相对狭窄的应用子域。然而,借助神经辐射场等三维模型的最新进展,一些研究表明三维技术终于能够通过将独立二维视图融合到三维空间并对其进行去噪来提升从二维视图中提取的输出。这在 egocentric 视频中尤其有用,但仅限于场景本身为静态的假设。事实上,正如 EPIC Fields 最近的分析所示,三维技术在处理动态现象时——特别是在分割运动目标时——并不有效。本文我们更深入地探讨了这一问题。首先,我们提出通过将来自二维模型的运动分割预测融合到分层辐射场中(层次运动融合)来改进三维中的动态分割。然而,长时间的动态视频的高复杂度使得捕捉底层几何结构具有挑战性,从而阻碍了将运动线索融合到(不完整的)场景几何中。我们通过测试时精炼来解决这一问题,该方法有助于模型聚焦于特定帧,从而降低数据复杂度。这导致了运动融合与精炼之间的协同作用,进而导致三维模型的分割预测相较于二维基准提高了大幅度。这表明即使在具有挑战性且真实可感的情境下,三维技术也能够提升二维分析中针对动态现象的表现。

关键词

引用

@article{arxiv.2506.05546,
  title  = {Layered Motion Fusion: Lifting Motion Segmentation to 3D in Egocentric Videos},
  author = {Vadim Tschernezki and Diane Larlus and Iro Laina and Andrea Vedaldi},
  journal= {arXiv preprint arXiv:2506.05546},
  year   = {2025}
}

备注

Camera-ready for CVPR25