中文

用于长时体积视频的时域高斯层次表示

计算机视觉与模式识别 2024-12-13 v1 图形学 多媒体

摘要

本文旨在解决从多视角RGB视频重建长时体积视频的挑战。最近的动态视图合成方法利用强大的4D表示,如特征网格或点云序列,实现了高质量渲染。然而,这些方法通常仅限于短(1-2秒)视频片段,并且在处理更长视频时往往面临巨大的内存占用问题。为了解决这个问题,我们提出了一种名为时域高斯层次(Temporal Gaussian Hierarchy)的新型4D表示,用于紧凑地建模长时体积视频。我们的关键观察是,动态场景中通常存在不同程度的时间冗余,即不同区域以不同速度变化。受此启发,我们构建了一个4D高斯原语的层次结构,每一层描述具有不同内容变化程度的场景区域,并自适应地共享高斯原语以表示不同时间段内不变的场景内容,从而有效减少高斯原语的数量。此外,高斯层次的树状结构使我们能够仅用部分高斯原语高效地表示特定时刻的场景,从而在训练或渲染过程中,无论视频长度如何,GPU内存占用都几乎恒定。大量实验结果表明,与现有方法相比,我们的方法在训练成本、渲染速度和存储占用方面均具有优越性。据我们所知,这是第一项能够高效处理分钟级体积视频数据并保持最先进渲染质量的工作。我们的项目页面可在 https://zju3dv.github.io/longvolcap 获取。

关键词

引用

@article{arxiv.2412.09608,
  title  = {Representing Long Volumetric Video with Temporal Gaussian Hierarchy},
  author = {Zhen Xu and Yinghao Xu and Zhiyuan Yu and Sida Peng and Jiaming Sun and Hujun Bao and Xiaowei Zhou},
  journal= {arXiv preprint arXiv:2412.09608},
  year   = {2024}
}

备注

SIGGRAPH Asia 2024 (TOG). Project page: https://zju3dv.github.io/longvolcap