面向3D视频会议的轻量化高保真低码率说话人脸压缩
计算机视觉与模式识别
2026-01-30 v1 人工智能
摘要
沉浸式和交互式通信的需求推动了3D视频会议的发展,但实现高保真3D说话人脸表示的低码率仍然是一个挑战。传统的2D视频压缩技术无法保留细粒度的几何和外观细节,而隐式神经渲染方法如 NeRF 则因计算成本高昂而难以接受。为此,我们提出一种轻量化、高保真、低码率3D说话人脸压缩框架,将 FLAME-based 参数建模与 3DGS 神经渲染集成。我们的方法仅实时传输essential facial metadata,实现高效重建,并使用基于高斯的头部模型。此外,我们引入一种紧凑的表示和压缩方案,包括高斯属性压缩和 MLP 优化,以增强传输效率。实验结果表明,我们的方法在率失真性能方面表现出色,在极低的码率下实现高质量的人脸渲染,使其适用于实时3D视频会议应用。
引用
@article{arxiv.2601.21269,
title = {Lightweight High-Fidelity Low-Bitrate Talking Face Compression for 3D Video Conference},
author = {Jianglong Li and Jun Xu and Bingcong Lu and Zhengxue Cheng and Hongwei Hu and Ronghua Wu and Li Song},
journal= {arXiv preprint arXiv:2601.21269},
year = {2026}
}