中文

基于注视点渲染的无运动搜索深度视频压缩

图像与视频处理 2022-03-31 v1 计算机视觉与模式识别

摘要

VR对文件体积更大、存储格式不同以及沉浸式观看条件的需求,给高质量VR内容的获取、传输、压缩和显示带来了重大挑战。同时,深度学习在推动视频压缩问题进展方面的巨大潜力引发了大量研究努力。由于VR的高带宽需求,使用空间变异的注视点压缩协议也引起了显著兴趣。我们整合这些技术创建了一个端到端深度学习视频压缩框架。我们新压缩模型的一个特点是省去了昂贵的基于搜索的运动预测计算。这是通过利用由位移帧差表达的视频运动中固有的统计规律性实现的。注视点协议是理想的,因为在VR中观看的视频只有用户朝任意给定方向注视时的一小部分可能可见。此外,即使在当前视场(FOV)内,视网膜神经元的分辨率也随距注视投影点的(偏心率)距离迅速下降。在我们基于学习的方法中,我们通过引入注视点生成单元(FGU)实现注视点渲染,该单元生成引导码率分配的注视点掩码,在适当观看几何下显著提升压缩效率,同时让人几乎察觉不到额外视觉损失。我们的实验结果表明,我们称为注视点化无运动视频编解码器(Foveated MOVI-Codec)的新压缩模型能够在无需计算运动的情况下高效压缩视频,并在广泛使用的UVG数据集和HEVC标准B类测试序列上优于H.264和H.265的注视点化版本。

关键词

引用

@article{arxiv.2203.16490,
  title  = {Foveation-based Deep Video Compression without Motion Search},
  author = {Meixu Chen and Richard Webb and Alan C. Bovik},
  journal= {arXiv preprint arXiv:2203.16490},
  year   = {2022}
}