中文

端到端 Transformer 用于压缩视频质量增强

多媒体 2022-10-26 v1 计算机视觉与模式识别

摘要

近年来,卷积神经网络在压缩视频质量增强任务中取得了优异结果。最先进的方法主要通过可变形卷积来挖掘相邻帧的时空信息。然而,可变形卷积中的偏移场难以训练,且其训练不稳定性常导致偏移溢出,降低了关联建模的效率。本工作中,我们提出一种基于 Transformer 的压缩视频质量增强(TVQE)方法,由基于 Swin-AutoEncoder 的时空特征融合(SSTF)模块与基于通道注意力的质量增强(CAQE)模块组成。所提 SSTF 模块借助 Swin-AutoEncoder 学习局部与全局特征,提升了关联建模能力。同时,基于窗口机制的 Swin Transformer 与编码器-解码器结构大幅提高了执行效率。另一方面,所提 CAQE 模块计算通道注意力,聚合特征图中通道间的时序信息,最终实现帧间信息的高效融合。在 JCT-VT 测试序列上的大量实验结果表明,所提方法在主观与客观质量上平均均取得更优性能。同时,我们提出的方法在推理速度与 GPU 消耗方面均优于现有方法。

关键词

引用

@article{arxiv.2210.13827,
  title  = {End-to-end Transformer for Compressed Video Quality Enhancement},
  author = {Li Yu and Wenshuai Chang and Shiyu Wu and Moncef Gabbouj},
  journal= {arXiv preprint arXiv:2210.13827},
  year   = {2022}
}