Pleno-Generation:一种具备带宽智能的可扩展生成式人脸视频压缩框架
计算机视觉与模式识别
2025-02-25 v1 图像与视频处理
摘要
基于生成模型的紧凑视频压缩通常在相对较窄的码率范围内运行,且往往侧重于超低码率应用。视频通信行业日益达成共识:生成式编码应实现全码率覆盖。然而,这是一项极其困难的任务,主要因为生成与压缩尽管相关,却具有不同的目标和权衡。所提出的 Pleno-Generation (PGen) 框架凭借带宽智能利用更宽的带宽进行生成,在确保视频编码鲁棒性方面展现出卓越能力,从而独树一帜。具体而言,我们以人脸视频编码开启 PGen 的研究,PGen 提供了一种优先保证高保真重建而非追求紧凑码流的范式转变。新颖的 PGen 框架利用可扩展表示和分层重建来实现生成式人脸视频压缩 (Generative Face Video Compression, GFVC),试图赋予不同粒度的码流以智能。实验结果表明,所提出的 PGen 框架能够促进现有的 GFVC 算法更好地提供高保真且忠实的人脸视频。此外,该框架为编码应用提供了更大的灵活性空间,并在更宽的码率范围内在各种质量评估中展现出更优的 RD 性能。此外,与最新的通用视频编码 (Versatile Video Coding, VVC) 编解码器相比,所提方案在感知级评估中取得了具有竞争力的 Bj{\o}ntegaard-delta-rate 节省。
引用
@article{arxiv.2502.17085,
title = {Pleno-Generation: A Scalable Generative Face Video Compression Framework with Bandwidth Intelligence},
author = {Bolin Chen and Hanwei Zhu and Shanzhi Yin and Lingyu Zhu and Jie Chen and Ru-Ling Liao and Shiqi Wang and Yan Ye},
journal= {arXiv preprint arXiv:2502.17085},
year = {2025}
}