中文

利用码流元数据实现快速、准确且通用的压缩视频质量增强

图像与视频处理 2023-10-31 v3 计算机视觉与模式识别 机器学习

摘要

视频压缩是现代互联网的一项核心特性,支撑着从社交媒体到视频会议的各项技术。尽管视频压缩持续成熟,对于许多压缩设置,质量损失仍可被察觉。这些设置 nevertheless 在带宽受限或其他不稳定连接下高效传输视频方面具有重要应用。本工作中,我们开发了一种深度学习架构,能够利用嵌入于视频码流中的底层结构与运动信息来恢复压缩视频的细节。我们表明,与先前的压缩校正方法相比这提升了恢复精度,并且在率失真方面与近期基于深度学习的视频压缩方法相比具有竞争力,同时实现了更高吞吐量。此外,我们以码流中易于获得的量化数据为条件训练模型。这使得我们的单一模型能够处理多种不同压缩质量设置,而先前工作需使用模型集成。

关键词

引用

@article{arxiv.2202.00011,
  title  = {Leveraging Bitstream Metadata for Fast, Accurate, Generalized Compressed Video Quality Enhancement},
  author = {Max Ehrlich and Jon Barker and Namitha Padmanabhan and Larry Davis and Andrew Tao and Bryan Catanzaro and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2202.00011},
  year   = {2023}
}

备注

WACV 2024