中文

结合眨眼嵌入与哈希网格关键点编码的音频驱动说话人脸生成

计算机视觉与模式识别 2026-01-28 v1

摘要

动态神经辐射场(NeRF)在生成高保真说话肖像 3D 模型方面取得了显著成功。尽管在渲染速度和生成质量上取得了重大进展,但在准确且高效地捕捉说话肖像的嘴部运动方面仍存在挑战。为了应对这一挑战,本研究提出了一种基于眨眼嵌入和哈希网格关键点编码的自动方法,该方法可以大幅提升说话人脸的保真度。具体而言,我们将编码为条件特征的面部特征,通过动态关键点 Transformer(Dynamic Landmark Transformer)将音频特征作为残差项集成到我们的模型中。此外,我们采用神经辐射场对整个人脸进行建模,从而获得栩栩如生的人脸表示。实验评估验证了我们的方法相对于现有方法的优越性。

关键词

引用

@article{arxiv.2601.18849,
  title  = {Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding},
  author = {Yuhui Zhang and Hui Yu and Wei Liang and Sunjie Zhang},
  journal= {arXiv preprint arXiv:2601.18849},
  year   = {2026}
}