中文

一种用于高效语音驱动说话人脸生成的统一压缩框架

声音 2023-05-01 v2 计算机视觉与模式识别 图形学 机器学习 音频与语音处理

摘要

虚拟人在娱乐和电商等众多行业受到相当关注。作为一项核心技术,从目标语音和人脸身份合成照片级真实人脸帧已借助生成对抗网络得到积极研究。尽管现代说话人脸生成模型取得了显著成果,它们常带来高计算负担,限制了其高效部署。本研究旨在开发一种轻量级语音驱动说话人脸合成模型。我们通过移除残差块并缩减通道宽度,从流行的说话人脸生成器 Wav2Lip 构建了一个紧凑生成器。我们还提出了一种知识蒸馏方案,以稳定且有效地在无对抗学习情况下训练小容量生成器。我们将参数数量和 MACs 减少了 28×\times,同时保留了原始模型的性能。此外,为缓解将整个生成器转换为 INT8 精度时的严重性能下降,我们采用选择性量化方法,对量化敏感层使用 FP16,对其他层使用 INT8。利用该混合精度,我们在边缘 GPU 上实现了高达 19×\times 的加速,且无明显损害生成质量。

关键词

引用

@article{arxiv.2304.00471,
  title  = {A Unified Compression Framework for Efficient Speech-Driven Talking-Face Generation},
  author = {Bo-Kyeong Kim and Jaemin Kang and Daeun Seo and Hancheol Park and Shinkook Choi and Hyoung-Kyu Song and Hyungshin Kim and Sungsu Lim},
  journal= {arXiv preprint arXiv:2304.00471},
  year   = {2023}
}

备注

MLSys Workshop on On-Device Intelligence, 2023; Demo: https://huggingface.co/spaces/nota-ai/compressed_wav2lip