中文

基于 EgoGaussian 的以 egocentric 视频为输入的动态场景理解

计算机视觉与模式识别 2024-10-03 v2

摘要

人类活动本质上是复杂的,通常涉及大量物体交互。为了更好地理解这些活动,关键在于建模其与通过动态变化捕获的环境之间的交互。最近可负担的头戴式摄像头和 egocentric 数据提供了更易于高效理解人类在 3D 环境中与物体交互的手段。然而,大多数现有的人类活动建模方法忽略了与物体的动态交互,导致仅提供静态表示。少数现有解决方案通常需要来自多个来源的输入,包括多摄像头设置、深度感应摄像头或 kinesthetic 传感器。为此,我们引入 EgoGaussian,首个能够同时从 RGB egocentric 输入重建 3D 场景并动态跟踪 3D 物体运动的方法。我们利用高斯渲染的离散特性,将动态交互从背景中分离,两者都具有明确的表示。我们的方法采用基于 clip 的在线学习管道,利用人类活动的动态特性,使我们能够按时间顺序重建场景的演变并跟踪刚性物体运动。EgoGaussian 在动态物体和背景重建质量方面均比最先进的方法显著提高。我们还定性地演示了重建模型的高质量。

关键词

引用

@article{arxiv.2406.19811,
  title  = {EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting},
  author = {Daiwei Zhang and Gengyan Li and Jiajie Li and Mickaël Bressieux and Otmar Hilliges and Marc Pollefeys and Luc Van Gool and Xi Wang},
  journal= {arXiv preprint arXiv:2406.19811},
  year   = {2024}
}