中文

Face Anything:从任意图像序列进行 4D 人脸重建

计算机视觉与模式识别 2026-04-22 v1

摘要

从图像序列中精确重建与跟踪动态人脸极具挑战性,因为非刚性形变、表情变化和视角变化同时发生,在几何与对应估计中产生显著歧义。我们提出了一种基于典范人脸点预测的统一高保真 4D 人脸重建方法,该表示为每个像素在共享的典范空间中分配一个归一化人脸坐标。该表述将密集跟踪与动态重建转化为典范重建问题,在单一前馈模型内实现时间一致的几何与可靠的对应。通过联合预测深度与典范坐标,我们的方法在单一架构内实现了精确的深度估计、时间稳定的重建、密集 3D 几何以及稳健的人脸点跟踪。我们使用基于 Transformer 的模型实现该表述,该模型联合预测深度与典范人脸坐标,并使用非刚性扭曲到典范空间的多视图几何数据进行训练。在图像与视频基准上的大量实验表明,在重建与跟踪任务上均达到了 SOTA 性能,对应误差比先前的动态重建方法低约 3 倍,推理速度更快,同时深度精度提高了 16%。这些结果突出了典范人脸点预测作为统一前馈 4D 人脸重建有效基础的价值。

关键词

引用

@article{arxiv.2604.19702,
  title  = {Face Anything: 4D Face Reconstruction from Any Image Sequence},
  author = {Umut Kocasari and Simon Giebenhain and Richard Shaw and Matthias Nießner},
  journal= {arXiv preprint arXiv:2604.19702},
  year   = {2026}
}

备注

Project website: https://kocasariumut.github.io/FaceAnything/ , Video: https://www.youtube.com/watch?v=wSGHpAscp0Y