结合眨眼嵌入与哈希网格关键点编码的音频驱动说话人脸生成
计算机视觉与模式识别
2026-01-28 v1
摘要
动态神经辐射场(NeRF)在生成高保真说话肖像 3D 模型方面取得了显著成功。尽管在渲染速度和生成质量上取得了重大进展,但在准确且高效地捕捉说话肖像的嘴部运动方面仍存在挑战。为了应对这一挑战,本研究提出了一种基于眨眼嵌入和哈希网格关键点编码的自动方法,该方法可以大幅提升说话人脸的保真度。具体而言,我们将编码为条件特征的面部特征,通过动态关键点 Transformer(Dynamic Landmark Transformer)将音频特征作为残差项集成到我们的模型中。此外,我们采用神经辐射场对整个人脸进行建模,从而获得栩栩如生的人脸表示。实验评估验证了我们的方法相对于现有方法的优越性。
引用
@article{arxiv.2601.18849,
title = {Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding},
author = {Yuhui Zhang and Hui Yu and Wei Liang and Sunjie Zhang},
journal= {arXiv preprint arXiv:2601.18849},
year = {2026}
}