基于率失真自编码器的视频压缩
图像与视频处理
2020-05-11 v2 机器学习
机器学习
摘要
在本文中,我们提出了一种用于有损视频压缩的深度生成模型。我们采用的模型由一个具有离散潜空间的三维自编码器和用于熵编码的自回归先验组成。自编码器和先验被联合训练以最小化率失真损失,该损失与变分自编码器中使用的ELBO密切相关。尽管方法简单,我们发现其性能优于基于运动补偿或插值的当前最先进的学习视频压缩网络。我们系统地评估了各种设计选择,例如基于帧或时空自编码器的使用,以及自回归先验的类型。此外,我们提出了基本方法的三种扩展,展示了相对于经典压缩方法的优势。首先,我们引入语义压缩,其中模型被训练为向感兴趣对象分配更多比特。其次,我们研究自适应压缩,其中模型被适配到变异性有限的定义域,例如自动驾驶汽车拍摄的视频,以在该定义域上实现更优压缩。最后,我们引入多模态压缩,其中我们展示了我们的模型在对由非标准成像传感器(如四摄相机)捕获的多种模态进行联合压缩时的有效性。我们认为这开启了经典编解码器无法实现的新颖视频压缩应用。
引用
@article{arxiv.1908.05717,
title = {Video Compression With Rate-Distortion Autoencoders},
author = {Amirhossein Habibian and Ties van Rozendaal and Jakub M. Tomczak and Taco S. Cohen},
journal= {arXiv preprint arXiv:1908.05717},
year = {2020}
}
备注
Accepted to ICCV 2019