SC-HVPPNet: 结合 CNN 与 Transformer 的空间与通道混合注意力视频后处理网络
计算机视觉与模式识别
2024-04-24 v1 图像与视频处理
摘要
卷积神经网络 (CNN) 和 Transformer 近期在视频后处理 (VPP) 领域引起了广泛关注。然而,现有 VPP 方法中 CNN 与 Transformer 之间的交互尚未被充分探索,导致提取的局部与全局特征之间的通信效率低下。在本文中,我们探索了 VPP 任务中 CNN 与 Transformer 之间的交互,并提出了一种新颖的空间与通道混合注意力视频后处理网络 (SC-HVPPNet),该网络能够协同利用空间和通道域中的图像先验。具体而言,在空间域中,设计了一个新颖的空间注意力融合模块,通过生成两个注意力权重来协同融合局部和全局表示。在通道域中,开发了一个新颖的通道注意力融合模块,能够在通道维度上动态混合深层表示。大量实验表明,SC-HVPPNet 显著提升了视频恢复质量,在 VTM-11.0-NNVC RA 配置下,Y、U 和 V 分量的平均比特率分别节省了 5.29%、12.42% 和 13.09%。
关键词
引用
@article{arxiv.2404.14709,
title = {SC-HVPPNet: Spatial and Channel Hybrid-Attention Video Post-Processing Network with CNN and Transformer},
author = {Tong Zhang and Wenxue Cui and Shaohui Liu and Feng Jiang},
journal= {arXiv preprint arXiv:2404.14709},
year = {2024}
}