中文

QUEEN:用于流式自由视点视频的量化高效高斯编码

计算机视觉与模式识别 2024-12-06 v1 人工智能

摘要

在线自由视点视频(FVV)流式传输是一个具有挑战性且尚未充分探索的问题。它需要对体积表示进行增量式更新,快速训练和渲染以满足实时性要求,并且模型要小以便于传输。实现这一目标可以增强用户体验,并催生新颖的应用,例如3D视频会议和实时视频广播。在本文中,我们提出了一种基于3D高斯泼溅(3D-GS)的流式FVV量化高效编码(QUEEN)框架。QUEEN在每个时间步直接学习连续帧之间高斯属性残差,而不对其施加任何结构约束,从而实现了高质量的重建和良好的泛化能力。为了高效存储残差,我们进一步提出了一种量化-稀疏化框架,其中包含一个学习到的潜在解码器,用于有效量化除位置外的属性残差,以及一个学习到的门控模块,用于稀疏化位置残差。我们提出使用高斯视角空间梯度差向量来区分场景中的静态和动态内容。该向量可作为有效稀疏化学习的指导,并加速训练。在多个FVV基准测试中,QUEEN在所有评估指标上均优于最先进的在线FVV方法。值得注意的是,对于多个高度动态的场景,QUEEN将模型大小缩减至每帧仅0.7 MB,训练时间少于5秒,并以超过350 FPS的速度渲染。项目页面:https://research.nvidia.com/labs/paras/projects/queen。

关键词

引用

@article{arxiv.2412.04469,
  title  = {QUEEN: QUantized Efficient ENcoding of Dynamic Gaussians for Streaming Free-viewpoint Videos},
  author = {Sharath Girish and Tianye Li and Amrita Mazumdar and Abhinav Shrivastava and David Luebke and Shalini De Mello},
  journal= {arXiv preprint arXiv:2412.04469},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024, Project website: https://research.nvidia.com/labs/amri/projects/queen