FSRT:基于外观、头部姿态与面部表情特征分解的面部重演面部场景表示 Transformer
计算机视觉与模式识别
2024-06-11 v2
摘要
面部重演任务是将驱动视频中的头部运动和面部表情迁移到源图像的外观上,源图像与驱动视频可能属于不同的人(跨重演)。现有大多数方法基于 CNN,估计从源图像到当前驱动帧的光流,然后对其进行修复与细化以生成输出动画。我们提出一种基于 Transformer 的编码器,用于计算源图像的集合潜在表示。随后,我们使用基于 Transformer 的解码器预测查询像素的输出颜色,该解码器以从驱动帧提取的关键点和面部表情向量为条件。源人物的潜在表示以自监督方式学习,将其外观、头部姿态和面部表情进行分解。因此,它们非常适合跨重演。与大多数相关工作不同,我们的方法可自然扩展至多张源图像,从而能够适应特定人物的面部动态。我们还提出了数据增强和正则化方案,这对于防止过拟合并支持所学表示的泛化能力是必要的。我们在一项随机用户研究中评估了该方法。结果表明,在运动迁移质量和时间一致性方面,其性能优于现有技术。
引用
@article{arxiv.2404.09736,
title = {FSRT: Facial Scene Representation Transformer for Face Reenactment from Factorized Appearance, Head-pose, and Facial Expression Features},
author = {Andre Rochow and Max Schwarz and Sven Behnke},
journal= {arXiv preprint arXiv:2404.09736},
year = {2024}
}
备注
Accepted to CVPR 2024