中文

SelfTalk:用于理解三维说话人脸的自监督交换训练图

计算机视觉与模式识别 2023-08-31 v2

摘要

语音驱动的 3D 人脸动画技术将其应用扩展至多种多媒体领域。以往研究已从音频信号生成了具有前景的真实唇部运动与面部表情。然而,传统仅由数据驱动的回归模型面临若干本质问题,如难以获取精确标签以及不同模态间的域差距,导致结果缺乏精度与连贯性而不尽如人意。为提升生成唇部运动的视觉准确度并减少对标注数据的依赖,我们提出一种新颖框架 SelfTalk,通过在跨模态网络系统中引入自监督来学习 3D 说话人脸。该框架构建由面部动画器、语音识别器和唇读解释器三个模块组成的网络系统。SelfTalk 的核心是一个交换训练图,促进音频、文本与唇形之间的兼容特征交换,使我们的模型学习这些因素间的复杂关联。所提框架利用从唇读解释器中学到的知识生成更合理的唇形。大量实验与用户研究表明,我们提出的方法在定性与定量上均达到最先进(state-of-the-art)性能。建议观看补充视频。

关键词

引用

@article{arxiv.2306.10799,
  title  = {SelfTalk: A Self-Supervised Commutative Training Diagram to Comprehend 3D Talking Faces},
  author = {Ziqiao Peng and Yihao Luo and Yue Shi and Hao Xu and Xiangyu Zhu and Jun He and Hongyan Liu and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2306.10799},
  year   = {2023}
}

备注

Accepted by ACM MM 2023