中文

NN-VVC:通过自监督学习的机器图像编码增强的多功能视频编码

图像与视频处理 2024-01-22 v1 计算机视觉与模式识别

摘要

人工智能的最新进展导致机器分析算法(主要是神经网络)对图像和视频的使用不断增加。尽管如此,媒体的压缩、存储和传输传统上是设计为供人类观看的。近期关于面向机器分析的图像和视频编码的研究主要在两个几乎正交的方向上取得进展。第一个方向是端到端(E2E)学习编解码器,虽然其在图像编码方面提供了高性能,但尚未达到最先进的传统视频编解码器的水平,且缺乏互操作性。第二个方向考虑将多功能视频编码(VVC)标准或任何其他传统视频编解码器(CVC)与针对机器分析的预处理和后处理操作结合使用。虽然基于 CVC 的方法受益于互操作性以及广泛的硬件和软件支持,但机器任务性能往往低于预期水平,特别是在低比特率下。本文提出了一种名为 NN-VVC 的混合机器编解码器,它结合了 E2E 学习图像编解码器和 CVC 的优势,以实现面向机器的图像和视频编码的高性能。我们的实验表明,当在多个不同数据集和机器视觉任务上进行评估时,所提出的系统在图像和视频数据上分别实现了比 VVC 高达 -43.20% 和 -26.8% 的 Bj{\o}ntegaard Delta 码率降低。据我们所知,这是第一篇展示混合视频编解码器在多个数据集和多种机器视觉任务上优于 VVC 的研究论文。

关键词

引用

@article{arxiv.2401.10761,
  title  = {NN-VVC: Versatile Video Coding boosted by self-supervisedly learned image coding for machines},
  author = {Jukka I. Ahonen and Nam Le and Honglei Zhang and Antti Hallapuro and Francesco Cricri and Hamed Rezazadegan Tavakoli and Miska M. Hannuksela and Esa Rahtu},
  journal= {arXiv preprint arXiv:2401.10761},
  year   = {2024}
}

备注

ISM 2023 Best paper award winner version