SemanticFace:基于语义蒸馏的可解释空间面部动作估计
计算机视觉与模式识别
2026-03-19 v2
摘要
从单张图像进行面部动作估计通常被形式化为预测或拟合紧凑表达空间中的参数,该空间缺乏明确的语义可解释性。然而,许多实际应用,如数字人偶控制和人机交互,都需要对应于有意义肌肉运动的可解释面部动作。为此,本文提出SemanticFace,一个在可解释ARKit混合blendshape空间中进行面部动作估计的框架,将系数预测重新表述为结构化语义推理。SemanticFace采用两种阶段的语义蒸馏范式:首先从 ground-truth ARKit系数中推导结构化语义监督信号,然后将此类知识蒸馏到多模态大语言模型,以从图像中预测可解释的面部动作系数。广泛的实验表明,语言对齐的语义监督不仅可以提高系数的精度和感知一致性,还能实现强大的跨身份 generalization和对大规模领域偏移(包括卡通脸部)的鲁棒性。
引用
@article{arxiv.2603.14827,
title = {SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space},
author = {Zejian Kang and Kai Zheng and Yuanchen Fei and Wentao Yang and Hongyuan Zou and Xiangru Huang},
journal= {arXiv preprint arXiv:2603.14827},
year = {2026}
}