交互式人脸视频编码:一种生成式压缩框架
计算机视觉与模式识别
2025-09-19 v2
摘要
本文提出一种新颖的交互式人脸视频编码(IFVC)框架,该框架允许人类与内在视觉表示而非信号进行交互。所提出的方案具有若干显著优势,包括超紧凑表示、低延迟交互以及生动的表情/头部姿态动画。特别地,我们提出基于内部维度增加(IDI)的表示,在保持合理表示成本的同时,极大提升了外观渲染的保真度与灵活性。通过利用强统计规律性,视觉信号可被有效投影至三维空间中的可控语义(例如嘴部运动、眨眼、头部旋转、头部平移与头部位置)并加以压缩与传输。该可编辑码流天然支持语义层面的交互性,并可通过深度生成模型的强推断能力合成人脸帧。实验结果已证明我们所提 IFVC 方案的性能优越性与应用前景。特别地,该方案在人脸视频的率失真性能上不仅优于最先进的视频编码标准通用视频编码(VVC)与最新的生成式压缩方案,还实现了无需引入额外操控过程的交互式编码。此外,该框架有望为元宇宙中数字人类通信的未来设计提供启示。
引用
@article{arxiv.2302.09919,
title = {Interactive Face Video Coding: A Generative Compression Framework},
author = {Bolin Chen and Zhao Wang and Binzhe Li and Shurun Wang and Shiqi Wang and Yan Ye},
journal= {arXiv preprint arXiv:2302.09919},
year = {2025}
}