4D-MoDe:基于运动解耦 4D 高斯压缩的可编辑可扩展体积流
计算机视觉与模式识别
2025-09-23 v1
摘要
体积视频作为沉浸式远距离会话和增强/虚拟现实的关键媒介,使能实现六自由度 (6DoF) 导航和真实空间交互。然而,由于数据体积庞大、运动复杂以及现有表示方式的编辑性有限,大规模交付高质量动态体积内容仍面临挑战。本文提出 4D-MoDe,一种面向可扩展和可编辑体积视频流的运动解耦 4D 高斯压缩框架。该方法引入分层表示,通过基于前瞻的运动分解策略显式分离静态背景与动态前景,显著减少时序冗余,实现背景/前景的选择性流式传输。为捕捉连续运动轨迹,我们采用多分辨率运动估计网格和轻量级共享 MLP,并辅以动态高斯补偿机制以建模新出现的视觉内容。此外,采用自适应分组方案动态插入背景关键帧,以平衡时序一致性与压缩效率。进一步地,采用熵感知训练管道,在率失真 (RD) 目标下联合优化运动场和高斯参数,同时采用基于范围的压缩和 KD 树压缩以最小化存储开销。广泛的实验表明,4D-MoDe 在多个数据集上始终实现了具竞争力的重建质量(例如,帧存储成本降至 \textbf{11.4} KB),较最新方法降低约一个数量级,同时支持背景替换和仅传输前景等实际应用。
引用
@article{arxiv.2509.17506,
title = {4D-MoDe: Towards Editable and Scalable Volumetric Streaming via Motion-Decoupled 4D Gaussian Compression},
author = {Houqiang Zhong and Zihan Zheng and Qiang Hu and Yuan Tian and Ning Cao and Lan Xu and Xiaoyun Zhang and Zhengxue Cheng and Li Song and Wenjun Zhang},
journal= {arXiv preprint arXiv:2509.17506},
year = {2025}
}