中文

基于感兴趣区域的神经视频压缩

图像与视频处理 2022-11-03 v2 计算机视觉与模式识别 机器学习

摘要

人类并非以相同分辨率感知场景的所有部分,而是聚焦于少数感兴趣区域(ROI)。传统的基于对象的编解码器利用了这一生物学直觉,能够以非均匀方式分配比特以偏向显著区域,代价是其余区域失真增加:这种策略在低码率约束下可提升感知质量。近年来,已有若干神经编解码器被引入视频压缩,但它们在所有空间位置上均匀处理,缺乏基于ROI处理的能力。本文中,我们提出两种基于ROI的神经视频编码模型。首先,我们提出一种隐式模型,其输入为二值ROI掩码,并通过弱化背景失真来进行训练。其次,我们设计了一种显式潜变量缩放方法,可根据ROI掩码对不同空间区域的潜变量量化步长进行控制。通过大量实验,我们表明我们的方法在ROI的率失真(R-D)性能上优于所有基线。此外,它们可泛化至不同数据集以及推理时任意ROI。最后,它们在训练时不需要昂贵的像素级标注,因为使用合成ROI掩码性能几乎无退化。据我们所知,我们的方案是将基于ROI的能力集成到神经视频压缩模型中的首批解决方案。

关键词

引用

@article{arxiv.2203.01978,
  title  = {Region-of-Interest Based Neural Video Compression},
  author = {Yura Perugachi-Diaz and Guillaume Sautière and Davide Abati and Yang Yang and Amirhossein Habibian and Taco S Cohen},
  journal= {arXiv preprint arXiv:2203.01978},
  year   = {2022}
}

备注

Updated arxiv version to the camera-ready version after acceptance at British Machine Vision Conference (BMVC) 2022