基于机器学习的VVC帧内编码器高效QT-MTT划分方案
图像与视频处理
2022-12-29 v5
摘要
下一代通用视频编码(Versatile Video Coding, VVC)标准引入了一种新的多类型树(Multi-Type Tree, MTT)块划分结构,支持垂直和水平方向的二叉树(Binary-Tree, BT)和三叉树(Ternary-Tree, TT)划分。这种新方法在每个块深度上产生五种可能的划分,从而提高了VVC相对于前一代高效视频编码(High Efficiency Video Coding, HEVC)标准的编码效率,后者仅支持四叉树(Quad-Tree, QT)划分且每个块深度只有一种划分。然而,MTT也给编码器计算复杂度带来了相当大的影响。本文提出一种两阶段基于学习的技术来解决VVC帧内编码器中MTT的复杂度开销。在我们的方案中,输入块首先由卷积神经网络(Convolutional Neural Network, CNN)处理,通过描述每个4x4边缘处划分的概率向量来预测其空间特征。随后,决策树(Decision Tree, DT)模型利用该空间特征向量来预测每个块最可能的划分。最后,基于该预测,编码器仅由率失真(Rate-Distortion, RD)过程处理前N个最可能的划分。为了在广泛的图像内容上训练我们的CNN和DT模型,我们还提出了一个基于现有图像数据集并使用VVC参考软件编码器编码的公开VVC帧划分数据集。我们依赖前3配置的方案在比特率仅增加0.86%的情况下实现了46.6%的复杂度降低。前2配置实现了更高的69.8%复杂度降低,但带来2.57%的比特率损失。这些结果强调了与最先进(state-of-the-art)方案相比,在VTM帧内编码效率与复杂度降低之间更好的权衡。
引用
@article{arxiv.2103.05319,
title = {Machine Learning based Efficient QT-MTT Partitioning Scheme for VVC Intra Encoders},
author = {Alexandre Tissier and Wassim Hamidouche and Souhaiel Belhadj Dit Mdalsi and Jarno Vanne and Franck Galpin and Daniel Menard},
journal= {arXiv preprint arXiv:2103.05319},
year = {2022}
}