生成式模型在压缩领域的前沿:面向人脸视频编码的综述
计算机视觉与模式识别
2025-06-10 v1
摘要
深度生成式模型的兴起极大地推动了视频压缩的发展,彻底重塑了人脸视频编码的范式,其在语义感知表征和逼真合成方面的强大能力。生成式人脸视频编码 (Generative Face Video Coding, GFVC) 处于这场革命的前沿,它能够将复杂的人脸动态特征压缩为紧凑的潜在码,以实现编码端的比特流紧凑性,并利用强大的深度生成式模型从压缩后的潜在码重建高保真人脸信号。因此,这一精心设计的 GFVC 范式能够实现在极低比特率范围内的人脸视频高保真通信,远超最新的可变视频编码 (VVC) 标准的能力。为开拓基础研究并加速 GFVC 的演进,本文提出了首个全面综述 GFVC 技术,系统性地填补了理论创新与工业标准化之间的关键鸿沟。具体而言,我们首先综述了具有不同特征表示和优化策略的广泛 GFVC 方法,并进行了彻底的基准测试分析。此外,我们构建了一个基于主观平均意见得分 (Mean Opinion Score, MOS) 的大规模 GFVC 压缩人脸视频数据库,旨在识别适用于 GFVC 的最佳质量指标。我们还总结了 GFVC 的标准化潜力,提出了统一的高层语法并开发了一个低复杂度 GFVC 系统,这两者都有望推动未来的实际部署和应用。最后,我们展望了 GFVC 在工业应用中的潜力,并就当前挑战和未来机遇进行了深入探讨。
引用
@article{arxiv.2506.07369,
title = {Generative Models at the Frontier of Compression: A Survey on Generative Face Video Coding},
author = {Bolin Chen and Shanzhi Yin and Goluck Konuko and Giuseppe Valenzise and Zihan Zhang and Shiqi Wang and Yan Ye},
journal= {arXiv preprint arXiv:2506.07369},
year = {2025}
}