中文

L-STEC:基于长时空间时间增强上下文的学习型视频压缩

计算机视觉与模式识别 2025-12-16 v1

摘要

神经视频压缩近年来兴起,基于条件的方法优于传统编解码器。然而,大多数现有方法仅依赖前一帧的特征来预测时间上下文,导致两个关键问题。第一,短参考窗口遗漏了长时依赖和细粒度纹理细节。第二,仅传播特征级信息会在帧间累积误差,导致预测不准确和细微纹理丢失。为解决这些问题,我们提出了长时空间时间增强上下文(L-STEC)方法。我们首先通过 LSTM 扩展参考链以捕获长时依赖。然后,我们引入像素域中的变形空间上下文,通过多感受野网络融合空间时间信息,以更好地保留参考细节。实验结果表明,L-STEC 通过丰富上下文信息显著提升了压缩性能,与 DCVC-TCM 相比实现了 37.01% 的码率节省(PSNR)和 31.65%(MS-SSIM),超越了 VTM-17.0 和 DCVC-FM,建立了新的最先进性能。

关键词

引用

@article{arxiv.2512.12790,
  title  = {L-STEC: Learned Video Compression with Long-term Spatio-Temporal Enhanced Context},
  author = {Tiange Zhang and Zhimeng Huang and Xiandong Meng and Kai Zhang and Zhipin Deng and Siwei Ma},
  journal= {arXiv preprint arXiv:2512.12790},
  year   = {2025}
}

备注

Accepted to Data Compression Conference (DCC) 2026 as an oral paper