中文

基于神经网络的视频编码中的设计与实现

图像与视频处理 2023-09-15 v2

摘要

过去十年见证了深度学习在人脸识别、自动驾驶以及像 ChatGPT 这样的大语言模型等知名人工智能应用中的巨大成功。近来,深度学习的应用已扩展至更广范围,基于神经网络的视频编码便是其中之一。基于神经网络的视频编码可在两个不同层面进行:将基于神经网络 (NN-based) 的编码工具嵌入经典视频压缩框架,或完全基于神经网络构建整个压缩框架。本文详述了 JVET (ITU-T SG 16 WP 3 与 ISO/IEC JTC 1/SC29 联合视频专家团队) 以基于神经网络的视频编码 (NNVC) 之名在前一类别中的部分近期探索工作。具体而言,本文讨论了两项主要的 NN 视频编码技术,即基于神经网络的帧内预测与基于神经网络的环内滤波,二者已在 JVET 多个会议周期中研究并最终采纳进 NNVC 的参考软件。在 NNVC 之上进行了大量实验以评估所提技术的有效性。与 VTM-11.0_nnvc 相比,NNVC-4.0 中提出的 NN 编码工具在随机访问、低延迟与全帧内配置下,对 {Y, Cb, Cr} 分别平均可实现 {11.94%, 21.86%, 22.59%}、{9.18%, 19.76%, 20.92%} 与 {10.63%, 21.56%, 23.02%} 的 BD-rate 节省。

关键词

引用

@article{arxiv.2309.05846,
  title  = {Designs and Implementations in Neural Network-based Video Coding},
  author = {Yue Li and Junru Li and Chaoyi Lin and Kai Zhang and Li Zhang and Franck Galpin and Thierry Dumas and Hongtao Wang and Muhammed Coban and Jacob Ström and Du Liu and Kenneth Andersson},
  journal= {arXiv preprint arXiv:2309.05846},
  year   = {2023}
}