Tiny 不够小:通过混合知识蒸馏实现高质量、低资源的人脸动画模型
图形学
2026-02-13 v3 机器学习
多媒体
声音
音频与语音处理
摘要
训练用于语音驱动 3D 人脸动画的高质量、稳健机器学习模型需要大量多样且高质量的音频-动画配对数据集。为克服数据集不足的限制,近期研究引入了大型预训练语音编码器,这些编码器对输入音频的变化不够敏感,因此使人脸动画模型能够在说话人、音频质量和语言方面实现跨场景泛化。然而,所得的人脸动画模型体积庞大,仅能在专用设备上进行离线推理。在本工作中,我们探索了面向游戏开发的设备级实时人脸动画模型。通过混合知识蒸馏和伪标签化,我们克服了大数据集的不足。给定大型音频数据集,我们使用高性能教师模型训练非常小的学生模型。与预训练语音编码器不同,我们的学生模型仅由卷积和全连接层组成,消除了注意力上下文或循环更新的需求。在我们的实验中,我们证明了可以将内存占用降低至最高 3.4 MB,并将未来音频上下文缩减至最高 81 毫秒,同时保持高质量动画。这为在设备上进行推理铺平了道路,这是实现真实、模型驱动的数字角色的重要一步。
引用
@article{arxiv.2507.18352,
title = {Tiny is not small enough: High-quality, low-resource facial animation models through hybrid knowledge distillation},
author = {Zhen Han and Mattias Teye and Derek Yadgaroff and Judith Bütepage},
journal= {arXiv preprint arXiv:2507.18352},
year = {2026}
}
备注
Accepted to ACM TOG 2025 (SIGGRAPH journal track); Project page: https://electronicarts.github.io/tiny-voice2face/