中文

ViSA:面向实时上半身头像创建的 3D 感知视频遮挡

计算机视觉与模式识别 2025-12-10 v2

摘要

从单张输入图像生成高保真上半身 3D 头像仍是重要挑战。当前的 3D 头像生成方法依赖大型重建模型,虽然快速且能产生稳定的身体结构,但常出现纹理模糊和僵硬、不自然运动的伪影。相比之下,生成式视频模型在合成照片逼真且动态的结果方面表现有前景,但经常在不稳定的行为方面困难,包括身体结构错误和身份漂移。为解决这些限制,我们提出一种新方法,结合两种范式的优势。我们的框架采用 3D 重建模型提供稳健的结构和外观先验,进而指导实时自回归视频扩散模型进行渲染。该过程使模型能够实时合成高频率、照片逼真的细节和流畅的动力学,有效减少纹理模糊和运动僵硬,同时防止常见于视频生成方法的结构不一致。通过将 3D 重建的几何稳定性与视频模型的生成能力相统一,我们的方法产生具有真实外观和动态、时序一致运动的高保真数字头像。实验表明,我们的方法在视觉质量上显著减少伪影,并相较于领先方法实现显著提升,为游戏和虚拟现实等实时应用提供了稳健且高效的解决方案。项目页面:https://lhyfst.github.io/visa

关键词

引用

@article{arxiv.2512.07720,
  title  = {ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation},
  author = {Fan Yang and Heyuan Li and Peihao Li and Weihao Yuan and Lingteng Qiu and Chaoyue Song and Cheng Chen and Yisheng He and Shifeng Zhang and Xiaoguang Han and Steven Hoi and Guosheng Lin},
  journal= {arXiv preprint arXiv:2512.07720},
  year   = {2025}
}

备注

Project page: \url{https://lhyfst.github.io/visa}