基于分区图的VVC互编码快速块分区方法
计算机视觉与模式识别
2025-07-16 v2
摘要
在Versatile Video Coding(VVC)的新技术中,四分树与嵌套多类型树(QT+MTT)块结构通过提供更多灵活的块分区模式,实现了显著的编码收益。然而,VVC编码器中递归分区搜索会显著增加编码复杂度。为此,我们提出一种基于分区图的算法,以实现VVC互编码的快速块分区。基于我们先前针对 intra 编码的分区图方法,分析了VVC互编码的特征,从而改进了分区图,通过纳入MTT掩码实现早期终止。随后,我们开发了一个神经网络,用于预测分区图,该网络由若干特殊设计组成,包括堆叠的自上而下和自下而上处理、量化参数调制层以及分区自适应扭曲。此外,我们提出了双阈值决策方案,以实现复杂度降低与率失真(RD)性能损失之间的细粒度权衡。实验结果表明,所提方法在随机访问配置下实现了平均51.30%的编码时间节省,同时实现2.12%的比特率Bjontegaard增量(BDBR)。
引用
@article{arxiv.2504.18397,
title = {Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization},
author = {Kesen Zhao and Beier Zhu and Qianru Sun and Hanwang Zhang},
journal= {arXiv preprint arXiv:2504.18397},
year = {2025}
}