基于深度学习的通用视频编码帧内模式推导
图像与视频处理
2022-04-11 v1 计算机视觉与模式识别
多媒体
摘要
在帧内编码中,进行率失真优化(RDO)以从预定义候选列表中获得最优帧内模式。除残差信号外,最优帧内模式也需被编码并传输至解码端,消耗了大量编码比特。为进一步提升通用视频编码(VVC)中帧内编码的性能,本文提出一种智能帧内模式推导方法,称为基于深度学习的帧内模式推导(DLIMD)。具体而言,将帧内模式推导过程表述为多分类任务,旨在跳过帧内模式信令模块以缩减编码比特。DLIMD 的架构被设计为适应不同量化参数设置及可变编码块(包括非正方形块),并由单一训练模型处理。与现有基于深度学习的分类问题不同,除特征学习网络学到的特征外,手工特征也被输入至帧内模式推导网络。为与传统方法竞争,视频编解码器中利用一个额外的二值标志来指示采用 RDO 的选定方案。大量实验结果表明,所提方法在 VVC 测试模型平台上对 Y、U、V 分量平均可实现 2.28%、1.74%、2.18% 的码率削减,优于现有最优工作。
引用
@article{arxiv.2204.04059,
title = {Deep Learning-Based Intra Mode Derivation for Versatile Video Coding},
author = {Linwei Zhu and Yun Zhang and Na Li and Gangyi Jiang and Sam Kwong},
journal= {arXiv preprint arXiv:2204.04059},
year = {2022}
}
备注
19 pages, 7 figures, submitted to ACM TOMM