中文

AniTalker: 通过身份解耦的面部运动编码生成生动多样的说话人脸

计算机视觉与模式识别 2024-05-07 v1 人工智能

摘要

本文介绍了AniTalker,一个创新框架,旨在从单张肖像生成逼真的说话人脸。与现有主要关注唇形同步等言语线索且未能捕捉面部表情和非言语线索复杂动态的模型不同,AniTalker采用了一种通用运动表示。这种创新表示有效地捕捉了广泛的面部动态,包括微妙的表情和头部运动。AniTalker通过两种自监督学习策略增强运动描绘:第一种是通过在同一身份内从源帧重建目标视频帧来学习细微运动表示,第二种是利用度量学习开发身份编码器,同时主动最小化身份编码器和运动编码器之间的互信息。这种方法确保运动表示是动态的且不包含身份特定细节,显著减少了对标注数据的需求。此外,扩散模型与方差适配器的集成允许生成多样且可控的面部动画。该方法不仅展示了AniTalker创建详细且逼真面部运动的能力,还强调了其在为实际应用制作动态虚拟角色方面的潜力。合成结果可在https://github.com/X-LANCE/AniTalker查看。

关键词

引用

@article{arxiv.2405.03121,
  title  = {AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding},
  author = {Tao Liu and Feilong Chen and Shuai Fan and Chenpeng Du and Qi Chen and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2405.03121},
  year   = {2024}
}

备注

14 pages, 7 figures