中文

FT2TF:第一人称陈述文本到说话人脸生成

计算机视觉与模式识别 2024-11-21 v2

摘要

说话人脸生成在计算机视觉社区中获得了极大的关注,具有各种应用,包括AR、VR、远程会议、数字助手和虚拟化身。传统方法主要由音频驱动,必须处理音频存储和处理不可避免的资源密集型特性。为了应对这一挑战,我们提出了FT2TF——第一人称陈述文本到说话人脸生成,一种由第一人称陈述文本驱动的说话人脸生成的新型单阶段端到端流水线。与以往的工作不同,我们的模型在推理期间仅利用视觉和文本信息,而不依赖任何其他来源(例如,音频/地标/姿态)。在LRS2和LRS3数据集上进行了大量实验,并报告了多维度评估指标的结果。定量和定性结果均表明,FT2TF优于现有的相关方法并达到了SOTA。这一成就突显了我们的模型连接第一人称陈述和动态人脸生成的能力,为未来的工作提供了有启发性的指导。

关键词

引用

@article{arxiv.2312.05430,
  title  = {FT2TF: First-Person Statement Text-To-Talking Face Generation},
  author = {Xingjian Diao and Ming Cheng and Wayner Barrios and SouYoung Jin},
  journal= {arXiv preprint arXiv:2312.05430},
  year   = {2024}
}

备注

Accepted at WACV 2025