无误差传播的学习式视频压缩:基于双域渐进时序对齐
计算机视觉与模式识别
2025-12-12 v1
摘要
现有的学习式视频压缩框架在运动估计与补偿(ME/MC)之间存在准确性时序对齐与误差传播之间的困境。分离变换框架为帧内压缩和帧间压缩采用不同的变换,能实现卓越的速率-失真(R-D)性能,但会导致明显的误差传播;而统一变换框架通过共享变换消除误差传播,但在共享潜在域中的 ME/MC 性能有限。为此本文提出一种新型统一变换框架,集成双域渐进时序对齐与质量条件化专家混合(Quality-Conditioned Mixture-of-Expert, QCMoE),以实现学习式视频压缩的质量一致且无误差传播的流式传输。具体而言,我们提出双域渐进时序对齐,用于 ME/MC,采用粗糙像素域对齐和精炼潜在域对齐,以粗到细的方式显著增强时序上下文建模。粗糙像素域对齐利用来自单个参考帧的光流估计高效处理简单运动模式;而精炼潜在域对齐则在来自多个参考帧的潜在特征上构建 Flow-Guided Deformable Transformer(FGDT),实现复杂运动模式的长期运动细化(LTMR)。此外,我们设计 QCMoE 模块以实现连续比特率适应,动态为不同专家分配,以根据目标质量和内容调整每个像素的量化步长,而非依赖单一量化步长。QCMoE 允许实现连续且一致的速率控制,具备出色的 R-D 性能。实验结果表明,所提方法在与最先进技术之间取得竞争成绩,成功消除了误差传播。
引用
@article{arxiv.2512.10450,
title = {Error-Propagation-Free Learned Video Compression With Dual-Domain Progressive Temporal Alignment},
author = {Han Li and Shaohui Li and Wenrui Dai and Chenglin Li and Xinlong Pan and Haipeng Wang and Junni Zou and Hongkai Xiong},
journal= {arXiv preprint arXiv:2512.10450},
year = {2025}
}