中文

面向内容自适应的学习式视频压缩推理

图像与视频处理 2025-10-13 v2

摘要

虽然近期学习式视频编解码模型在低延迟和随机访问两种模式下的 BD-rate 性能均超过了传统编解码器在相同模式下的平均表现,但对于单个具有复杂/大位移视频的性能提升相对于简单运动场景要小得多。这与学习式编码器模型无法泛化到训练集中未见过的运动矢量范围有关,这会导致在流场编码以及帧预测编码方面的性能下降。为此,我们提出一种通用(模型无关)框架,通过在推理(编码)期间控制场景中运动矢量的尺度,以approximately匹配测试视频和训练视频中运动矢量的范围,通过自适应下采样帧来实现。这导致下采样后的运动矢量从而实现:i) 更好的流估计,从而进行帧预测;ii) 更高效的流压缩。我们展示,针对已是SOTA的低延迟视频编解码器 DCVC-FM 提出的框架在未进行任何模型微调的情况下,可提高最高达41%的 BD-rate 性能。我们present了消融研究,以证明运动和场景复杂度的度量可用于预测该框架的有效性。

关键词

引用

@article{arxiv.2510.07283,
  title  = {Content-Adaptive Inference for State-of-the-art Learned Video Compression},
  author = {Ahmet Bilican and M. Akın Yılmaz and A. Murat Tekalp},
  journal= {arXiv preprint arXiv:2510.07283},
  year   = {2025}
}

备注

This paper has been accepted for publication in the IEEE Open Journal of Signal Processing (OJSP) 2025