中文

STGV:面向高斯视频表征的时空哈希编码

计算机视觉与模式识别 2026-04-15 v2

摘要

2D 高斯溅射(2DGS)近期已成为高质量视频表征的一种有前景的范式。然而,现有方法采用内容无关或时空特征重叠的嵌入来预测规范高斯原语的形变,这会将视频中的静态和动态成分纠缠在一起,并阻碍对其不同性质的有效建模。这些问题导致时空形变预测不准确,表征质量欠佳。为解决这些问题,本文提出了一种面向高斯视频表征的时空哈希编码框架(STGV)。通过将视频特征分解为可学习的 2D 空间和 3D 时间哈希编码,STGV 有效地促进了动态成分运动模式的学习,同时保持了静态元素的背景细节。此外,我们通过关键帧规范初始化策略,构建了一个更稳定、更一致的初始规范高斯表示,防止了特征重叠和结构不一致的几何表示。实验结果表明,与其他基于高斯的方法相比,我们的方法获得了更好的视频表征质量(+0.98 PSNR),并在下游视频任务中取得了有竞争力的性能。

关键词

引用

@article{arxiv.2604.10910,
  title  = {STGV: Spatio-Temporal Hash Encoding for Gaussian-based Video Representation},
  author = {Jierun Lin and Jiacong Chen and Qingyu Mao and Shuai Liu and Xiandong Meng and Fanyang Meng and Yongsheng Liang},
  journal= {arXiv preprint arXiv:2604.10910},
  year   = {2026}
}