中文

Text2Lip:基于视唇瓣引导的从文本生成逐步逼真的唇部同步说话面部

计算机视觉与模式识别 2025-08-05 v1 人工智能

摘要

生成语义连贯且视觉准确的说话面部需要在语言意义与面部 articulation 之间架起桥梁。尽管音频驱动方法仍占主导,但其对高质量配对音视频数据的依赖以及从声学到唇部动作的内在歧义在可扩展性和鲁棒性方面存在显著挑战。为此,我们提出 Text2Lip,一种以视唇瓣为中心的框架,通过将文本输入嵌入结构化的视唇瓣序列,构建语义-视觉桥梁。这些中层单元作为唇部动作预测的语言学先验。进一步,我们设计了基于课程学习的渐进式视唇瓣-音频替换策略,使模型能够逐步从真实音频过渡到通过跨模态注意力从增强视唇瓣特征重建的伪音频。这实现了音频存在和音频自由场景下的鲁棒生成。最后,一个以地标为导向的渲染器合成具有准确唇部同步的逼真面部视频。广泛的评估表明,Text2Lip 在语义忠实度、视觉逼真度和模态鲁棒性方面均优于现有方法,确立了一种可控且灵活的说话面部生成新范式。我们的项目主页为 https://plyon1.github.io/Text2Lip/。

关键词

引用

@article{arxiv.2508.02362,
  title  = {Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering},
  author = {Xu Wang and Shengeng Tang and Fei Wang and Lechao Cheng and Dan Guo and Feng Xue and Richang Hong},
  journal= {arXiv preprint arXiv:2508.02362},
  year   = {2025}
}