中文

面向生成人脸视频编码的轻量级双模式优化

计算机视觉与模式识别 2025-08-20 v1 图像与视频处理

摘要

生成人脸视频编码(GFVC)通过利用深度生成模型的强推理能力实现了出色的速率-失真性能。然而,其实际部署受限于大型模型参数和高计算成本。为解决这一问题,我们提出了轻量级GFVC框架,引入双模式优化——结合架构重构和操作细化——以降低复杂度而保持重建质量。从架构层面,我们用更纤细且更高效的层取代传统的3x3卷积,在不损害特征表达力的前提下降低了复杂度。从操作层面,我们开发了两阶段自适应通道修剪策略:(1)训练期间通过可学习阈值识别冗余通道进行软修剪;(2)训练后使用派生的掩码永久性地删除这些通道进行硬修剪。这种双阶段方法确保了训练稳定性和推理效率。实验结果表明,所提出的轻量级双模式优化可将GFVC的参数量降低90.4%,计算量节省88.9%,同时在感知级质量指标上优于最先进的视频编码标准通用视频编码(VVC)。因此,该方法有望在移动边缘设备等资源受限环境中实现高效的GFVC部署。

关键词

引用

@article{arxiv.2508.13547,
  title  = {A Lightweight Dual-Mode Optimization for Generative Face Video Coding},
  author = {Zihan Zhang and Shanzhi Yin and Bolin Chen and Ru-Ling Liao and Shiqi Wang and Yan Ye},
  journal= {arXiv preprint arXiv:2508.13547},
  year   = {2025}
}