从生成建模视角看神经视频压缩
图像与视频处理
2024-10-28 v2 计算机视觉与模式识别
机器学习
摘要
尽管近期的机器学习研究揭示了 VAE 等深度生成模型与学习式压缩中使用的率失真损失之间的联系,但这部分工作大多聚焦于图像。出于类似动机,我们通过深度自回归与潜变量建模的视角来审视近期提出的神经视频编码算法。我们将这些编解码器呈现为广义随机时间自回归变换的实例,并受标准化流(normalizing flows)与结构化先验启发,提出进一步改进的新途径。我们提出若干在高分辨率视频上取得最先进视频压缩性能的架构,并讨论其权衡与消融实验。具体而言,我们提出(i)改进的时间自回归变换,(ii)具有结构化与时间依赖性的改进熵模型,以及(iii)我们算法的可变码率版本。由于我们的改进与一大类现有模型兼容,我们进一步证明生成建模视角能够推动神经视频编码领域的发展。
引用
@article{arxiv.2107.13136,
title = {Insights from Generative Modeling for Neural Video Compression},
author = {Ruihan Yang and Yibo Yang and Joseph Marino and Stephan Mandt},
journal= {arXiv preprint arXiv:2107.13136},
year = {2024}
}
备注
This work has been submitted to the IEEE for publication as an extension work of arXiv:2010.10258. arXiv admin note: text overlap with arXiv:2010.10258