中文

基于上下文引导的 Transformer 熵模型用于视频压缩

计算机视觉与模式识别 2025-10-14 v2 多媒体

摘要

条件熵模型有效利用时空上下文以减少视频冗余。然而,融合时序上下文常会引入额外的模型复杂度并增加计算成本。与此同时,许多现有的空间上下文模型缺乏对空间依赖关系排序的显式建模,这可能限制了在解码期间获取相关上下文的能力。为此,我们提出了 Context Guided Transformer (CGT) 熵模型,该模型以抽取的时序上下文和依赖加权空间上下文为条件,估计当前帧的概率质量函数。时序上下文抽取器学习预定义的潜在查询,以使用 transformer 编码器提取关键时序信息,减少下游计算开销。同时,设计一个 teacher-student 网络作为依赖加权空间上下文分配器,显式建模空间上下文的依赖关系。teacher 生成注意力图表示 token 的重要性,并生成熵图反映预测确定性,从而指导 student 选择加权前 k 个最高空间依赖的 token。在推理阶段,仅使用 student 基于高依赖上下文预测未解码的 token。实验结果表明,我们的 CGT 模型在熵模型时间上约减少 65%,相较于前一最先进的条件熵模型实现约 11% 的 BD-Rate 降低。

关键词

引用

@article{arxiv.2508.01852,
  title  = {Context Guided Transformer Entropy Modeling for Video Compression},
  author = {Junlong Tong and Wei Zhang and Yaohui Jin and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2508.01852},
  year   = {2025}
}

备注

ICCV 2025. This is an update to the camera-ready version