中文

解锁姿态多样性:基于隐式关键点的高效精确时空扩散音频驱动说话人像生成

计算机视觉与模式识别 2025-03-18 v1

摘要

音频驱动的单图像说话人像生成在虚拟现实、数字人创建和电影制作中发挥着至关重要的作用。现有方法通常分为基于关键点的方法和基于图像的方法。基于关键点的方法能有效保留角色身份,但由于3D可变形模型(3D Morphable Model)的固定点限制,难以捕捉精细的面部细节。此外,传统生成网络在有限数据集上难以建立音频与关键点之间的因果关系,导致姿态多样性较低。相比之下,基于图像的方法利用扩散网络生成具有丰富细节的高质量人像,但会导致身份失真且计算成本高昂。在本工作中,我们提出了KDTalker,这是首个将无监督隐式3D关键点与时空扩散模型相结合的框架。利用无监督隐式3D关键点,KDTalker能够适应面部信息密度,使扩散过程能够灵活地对多样的头部姿态进行建模并捕捉精细的面部细节。专门设计的时空注意力机制确保了精确的唇部同步,在提高计算效率的同时,生成时间一致且高质量的动画。实验结果表明,KDTalker在唇部同步精度、头部姿态多样性和执行效率方面均达到了SOTA性能。我们的代码可在 https://github.com/chaolongy/KDTalker 获取。

关键词

引用

@article{arxiv.2503.12963,
  title  = {Unlock Pose Diversity: Accurate and Efficient Implicit Keypoint-based Spatiotemporal Diffusion for Audio-driven Talking Portrait},
  author = {Chaolong Yang and Kai Yao and Yuyao Yan and Chenru Jiang and Weiguang Zhao and Jie Sun and Guangliang Cheng and Yifei Zhang and Bin Dong and Kaizhu Huang},
  journal= {arXiv preprint arXiv:2503.12963},
  year   = {2025}
}