L-STEC:基于长时空间时间增强上下文的学习型视频压缩
计算机视觉与模式识别
2025-12-16 v1
摘要
神经视频压缩近年来兴起,基于条件的方法优于传统编解码器。然而,大多数现有方法仅依赖前一帧的特征来预测时间上下文,导致两个关键问题。第一,短参考窗口遗漏了长时依赖和细粒度纹理细节。第二,仅传播特征级信息会在帧间累积误差,导致预测不准确和细微纹理丢失。为解决这些问题,我们提出了长时空间时间增强上下文(L-STEC)方法。我们首先通过 LSTM 扩展参考链以捕获长时依赖。然后,我们引入像素域中的变形空间上下文,通过多感受野网络融合空间时间信息,以更好地保留参考细节。实验结果表明,L-STEC 通过丰富上下文信息显著提升了压缩性能,与 DCVC-TCM 相比实现了 37.01% 的码率节省(PSNR)和 31.65%(MS-SSIM),超越了 VTM-17.0 和 DCVC-FM,建立了新的最先进性能。
引用
@article{arxiv.2512.12790,
title = {L-STEC: Learned Video Compression with Long-term Spatio-Temporal Enhanced Context},
author = {Tiange Zhang and Zhimeng Huang and Xiandong Meng and Kai Zhang and Zhipin Deng and Siwei Ma},
journal= {arXiv preprint arXiv:2512.12790},
year = {2025}
}
备注
Accepted to Data Compression Conference (DCC) 2026 as an oral paper