中文

TALK-Act:利用扩散模型增强二维说话头像重演的纹理感知

计算机视觉与模式识别 2024-10-15 v1 图形学

摘要

近年来,由于面部动画技术的快速发展,二维说话头像越来越多地出现在日常场景中。然而,现有的大多数工作缺乏对人体运动的显式控制。在本文中,我们提出不仅驱动说话人的面部,还驱动其躯干和手势动作。受扩散模型最新进展的启发,我们提出了运动增强纹理感知说话头像重演(TALK-Act)框架,该框架仅需单目视频的短片段即可实现高保真度的头像重演。我们的关键思想是在扩散建模中通过显式运动引导来增强纹理感知。具体来说,我们精心构建了2D和3D结构信息作为中间引导。虽然最近的扩散模型采用侧网络来注入控制信息,但即使经过针对特定人物的微调,它们也难以合成时间上稳定的结果。我们提出了一个运动增强纹理感知模块,以增强驱动信号和目标信号之间的联系。此外,我们构建了一个基于记忆的手部恢复模块,以帮助解决手部形状保持的难题。预训练后,我们的模型仅需30秒的特定人物数据即可实现高保真度的二维头像重演。大量实验证明了我们提出框架的有效性和优越性。资源可在 https://guanjz20.github.io/projects/TALK-Act 获取。

关键词

引用

@article{arxiv.2410.10696,
  title  = {TALK-Act: Enhance Textural-Awareness for 2D Speaking Avatar Reenactment with Diffusion Model},
  author = {Jiazhi Guan and Quanwei Yang and Kaisiyuan Wang and Hang Zhou and Shengyi He and Zhiliang Xu and Haocheng Feng and Errui Ding and Jingdong Wang and Hongtao Xie and Youjian Zhao and Ziwei Liu},
  journal= {arXiv preprint arXiv:2410.10696},
  year   = {2024}
}

备注

Accepted to SIGGRAPH Asia 2024 (conference track). Project page: https://guanjz20.github.io/projects/TALK-Act