基于混合形状引导的面部表达生成
计算机视觉与模式识别
2025-10-07 v1
摘要
为 AI 驱动的叙事任务设计的人类中心生成模型,需要将两个核心能力结合起来:身份一致性和对人类表演的精确控制。虽然最近基于扩散的方法在保持面部身份方面取得了显著进展,但在不损失身份的情况下实现精细的表情控制仍然具有挑战性。在本工作中,我们提出一种基于扩散的框架,忠实地再现任何主体在特定面部表情下的情形。基于 ID 一致的人脸基础模型,我们采用包含由 FLAME 混合形状参数引导的表情交叉注意力模块,以实现显式控制。我们在包含丰富表情变化的图像和视频数据的多样化混合物上进行训练,该适配器不仅能泛化到基本情绪,还能处理先前作品忽视的细微微表情和表情过渡。在此基础上,一个可插拔的参考适配器可实现对实时图像中的表情编辑,通过在合成过程中将参考帧的外观传递给目标。广泛的定量和定性评估表明,我们的模型在针对性和身份一致性表情生成方面超越了现有方法。代码和模型可在 https://github.com/foivospar/Arc2Face 查阅。
引用
@article{arxiv.2510.04706,
title = {ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion},
author = {Foivos Paraperas Papantoniou and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:2510.04706},
year = {2025}
}
备注
ICCVW 2025, Code: https://github.com/foivospar/Arc2Face