中文

基于 CNN-层次注意力 Transformer 混合架构加速 HEVC 内部分区

图像与视频处理 2026-05-29 v1 计算机视觉与模式识别

摘要

HEVC 中的递归四叉树分区导致显著计算开销,对 CTU 分区预测的穷举率失真优化占主导时间。尽管深度学习分区预测作为编码加速器而涌现,但仍存在架构二元性:CNN 计算高效但受限于局部有效感受野,难以捕获长程语义关系和重复纹理;相反,Transformer 架构在捕获全局上下文方面更优,但因 CPU 延迟高昂而难以部署,而 CPU 是部署的主要受限因素。本文引入 Hybrid Fast Vision Transformer (HFViT),一种用于加速 HEVC 内模式分区预测的混合架构。HFViT 将可重参数化的深度分离卷积主干与层次注意力 Transformer (HAT) 机制融合,利用载体 token 方案实现亚二次复杂度的全局信息传播。后训练结构融合将 batch normalization 合并到前置层,从而进一步降低延迟。全面评估表明,HFViT 在不同分辨率下均能加速 HEVC 内编码。在标准 JCT-VC 测试序列上,HFViT 相较于竞争性 ETH-CNN 基线,在 Class A、B 和 E 中将平均 VMAF BD-rate 惩罚分别降低 2.4、2.6 和 7.9 个百分点,同时保持 CPU 推理延迟在 CNN 基线的 8% 内,且在 GPU 上超越 CNN 基线 40%,确立了实时编码器集成的实际可行性。

关键词

引用

@article{arxiv.2605.29063,
  title  = {Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid},
  author = {Krishna Kumar Sharma and Somdyuti Paul},
  journal= {arXiv preprint arXiv:2605.29063},
  year   = {2026}
}