SelfTalk:用于理解三维说话人脸的自监督交换训练图
计算机视觉与模式识别
2023-08-31 v2
摘要
语音驱动的 3D 人脸动画技术将其应用扩展至多种多媒体领域。以往研究已从音频信号生成了具有前景的真实唇部运动与面部表情。然而,传统仅由数据驱动的回归模型面临若干本质问题,如难以获取精确标签以及不同模态间的域差距,导致结果缺乏精度与连贯性而不尽如人意。为提升生成唇部运动的视觉准确度并减少对标注数据的依赖,我们提出一种新颖框架 SelfTalk,通过在跨模态网络系统中引入自监督来学习 3D 说话人脸。该框架构建由面部动画器、语音识别器和唇读解释器三个模块组成的网络系统。SelfTalk 的核心是一个交换训练图,促进音频、文本与唇形之间的兼容特征交换,使我们的模型学习这些因素间的复杂关联。所提框架利用从唇读解释器中学到的知识生成更合理的唇形。大量实验与用户研究表明,我们提出的方法在定性与定量上均达到最先进(state-of-the-art)性能。建议观看补充视频。
引用
@article{arxiv.2306.10799,
title = {SelfTalk: A Self-Supervised Commutative Training Diagram to Comprehend 3D Talking Faces},
author = {Ziqiao Peng and Yihao Luo and Yue Shi and Hao Xu and Xiangyu Zhu and Jun He and Hongyan Liu and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2306.10799},
year = {2023}
}
备注
Accepted by ACM MM 2023