KeyframeFace:通过语义关键帧实现语言驱动的面部动画
计算机视觉与模式识别
2026-05-13 v4
摘要
面部动画是计算机图形学(CG)行业创建数字角色的核心组件。典型的制作工作流依赖稀疏但语义上有意义的关键帧来精确控制面部表情。直接从自然语言描述实现此类动画可以显著提升内容创作效率和可及性。然而,大多数现有方法采用文本到连续帧范式,直接从语言回归密集的面部运动轨迹。该 formulation 将高层语义意图与底层运动耦合,缺乏显式的语义控制结构,限制了精确编辑与可解释性。借鉴动画制作中的关键帧范式,我们提出 KeyframeFace,一个通过可解释关键帧从语言实现语义面部动画的框架。我们的方法不预测密集运动轨迹,而是将动画表示为在可解释的基于 ARKit 的面部控制空间中的一系列语义关键帧。语言驱动模型利用大语言模型(LLM)先验,生成与上下文文本描述和情感线索对齐的关键帧。为支持该 formulation,我们构建了一个多模态数据集,包含 2,100 个表情脚本配对的单目视频、逐帧 ARKit 系数和人工标注的语义关键帧。实验表明,引入语义关键帧监督和语言先验显著提升了表情保真度和语义对齐,优于未使用面部动作语义的方法。
引用
@article{arxiv.2512.11321,
title = {KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes},
author = {Jingchao Wu and Zejian Kang and Haibo Liu and Yuanchen Fei and Xiangru Huang},
journal= {arXiv preprint arXiv:2512.11321},
year = {2026}
}