中文

从模糊到可信:利用 3D 生成先验增强低质量说话者头像

计算机视觉与模式识别 2026-02-09 v1

摘要

创建高保真、可动画的 3D 说话者头像对于沉浸式应用至关重要,但常受低质量图像或视频来源的制约,这些来源会导致较差的 3D 重建。本文引入 SuperHead,一个用于增强低分辨率、可动画 3D 头部头像的新型框架。核心挑战在于合成高质量的几何和纹理,同时在动画期间确保 3D 和时间一致性,并保留主体身份。尽管近期在图像、视频 和 3D 基于超分辨率 (SR) 的进展显著,但现有的 SR 技术难以处理动态 3D 输入。为此,SuperHead 通过一种新颖的 dynamics-aware 3D 逆演化方案,利用来自预训练 3D 生成模型的丰富先验。该过程优化生成模型的潜在表示,以产生超分辨率 3D 高斯溅射 (3DGS) 头部模型,然后将其绑定到底层参数化头部模型(例如 FLAME)用于动画。该逆演化通过稀疏收集的上采样 2D 面部渲染和对应的深度图进行联合监督,这些渲染图来自多样化的面部表情和相机视角,以确保在动态面部运动下的真实感。实验表明,SuperHead 在动态运动下生成具有精细面部细节的头像,在视觉质量方面显著优于基线方法。

关键词

引用

@article{arxiv.2602.06122,
  title  = {From Blurry to Believable: Enhancing Low-quality Talking Heads with 3D Generative Priors},
  author = {Ding-Jiun Huang and Yuanhao Wang and Shao-Ji Yuan and Albert Mosella-Montoro and Francisco Vicente Carrasco and Cheng Zhang and Fernando De la Torre},
  journal= {arXiv preprint arXiv:2602.06122},
  year   = {2026}
}

备注

Accepted to 3DV 2026. Project Page: https://humansensinglab.github.io/super-head/