中文

3DRealHead:基于few-shot方法的详细头部头像

计算机视觉与模式识别 2026-04-16 v1

摘要

人脸是交流的核心。对于沉浸式应用,数字化人的存在应镜像物理现实,捕捉用户的独特性特征和详细面部表情。然而,当前的3D头部头像方法在拥有多视角数据或学习到的先验条件下,仍难以忠实再现身份和面部表情。尤其是对于捕捉人类外观多样性的先验学习,特别是对于面部表情中高度个人化特征区域(如嘴部和牙齿区域),由于底层训练数据有限,仍具有挑战性。此外,许多头像方法仅依赖于3D形状可塑模型(3DMM)的表达控制,这严重限制了表达性。为解决这些挑战,我们引入了3DRealHead,这是一种基于few-shot方法的头部头像重建技术,采用从主体单摄像头视频流中提取的新颖表达控制信号。具体而言,主体只需拍摄几张自身照片,即可恢复3D头部头像并通过消费级网页摄像头驱动其动画。通过一种新的few-shot反向过程实现头像重建,该过程将表示为Style U-Net的3D人类头部先验,后者发出可在新视角下渲染的3D高斯原始素。该先验在NeRSemble数据集上学习。对于驱动头像的动画,U-Net在3DMM-based面部表情信号以及从驾驶视频中提取的嘴部区域特征条件化。这些额外的嘴部特征允许我们恢复3DMM无法表示的面部表情,从而实现更高的表达性并更贴近物理现实。

关键词

引用

@article{arxiv.2604.13171,
  title  = {3DRealHead: Few-Shot Detailed Head Avatar},
  author = {Jalees Nehvi and Timo Bolkart and Thabo Beeler and Justus Thies},
  journal= {arXiv preprint arXiv:2604.13171},
  year   = {2026}
}