SMIRK: 通过神经合成分析实现三维面部表情
计算机视觉与模式识别
2025-03-14 v2
摘要
虽然现有的从野外图像进行三维人脸重建的方法在恢复整体人脸形状方面表现出色,但它们通常会遗漏细微、极端、不对称或罕见的表情。我们通过SMIRK(基于图像的运动学重建空间建模)改进了这些方法,该方法能够从图像中忠实地重建富有表现力的三维人脸。我们识别出现有方法的两个关键局限性:其自监督训练公式的缺陷,以及训练图像中表情多样性的缺乏。在训练方面,大多数方法采用可微渲染将预测的人脸网格与输入图像进行比较,并辅以大量额外的损失函数。这种可微渲染损失不仅必须提供监督以优化三维人脸几何形状、相机、反照率和光照(这是一个不适定的优化问题),而且渲染与输入图像之间的域差距进一步阻碍了学习过程。相反,SMIRK用神经渲染模块取代了可微渲染,该模块在给定渲染的预测网格几何形状和输入图像的稀疏采样像素的情况下,生成一张人脸图像。由于神经渲染从采样的图像像素中获取颜色信息,使用基于神经渲染的重建损失进行监督可以仅关注几何形状。此外,它使我们能够在训练期间生成具有不同表情的输入身份图像。然后,这些图像被用作重建模型的输入,并作为具有真实几何形状的监督信号。这有效地扩充了训练数据,并增强了对多样化表情的泛化能力。我们的定性、定量,特别是感知评估表明,SMIRK在准确的表情重建上达到了新的最先进性能。项目网页:https://georgeretsi.github.io/smirk/。
引用
@article{arxiv.2404.04104,
title = {SMIRK: 3D Facial Expressions through Analysis-by-Neural-Synthesis},
author = {George Retsinas and Panagiotis P. Filntisis and Radek Danecek and Victoria F. Abrevaya and Anastasios Roussos and Timo Bolkart and Petros Maragos},
journal= {arXiv preprint arXiv:2404.04104},
year = {2025}
}