中文

面向情感连续的文本驱动式说话人脸生成

计算机视觉与模式识别 2026-03-09 v1 人工智能

摘要

说话人脸生成(TFG)旨在创建逼真且情感丰富的数字面孔。虽然前期 TFG 工作已掌握了自然面部运动的生成,但它们通常表现出固定的目标情感,缺乏类似人类在传递信息时所展现的持续变化和自然的表情能力。为生成逼真视频,我们提出了一种新任务,即情感连续说话人脸生成(EC-TFG),该任务以文本段落和带有情感变化描述的情感信息为驱动数据,旨在生成视频 wherein person 说话文本,同时反映描述中所包含的情感变化。同时,我们引入了定制模型,即时重点情感调制说话人脸生成(TIE-TFG),该模型创新性地通过采用时序强化情感涨落建模(Temporal-Intensive Emotion Fluctuation Modeling),允许其为输入文本提供情感变化序列,从而驱动合成视频中面部表情的连续变化。广泛的评估表明,我们的方法在制造平滑情感转换方面具有卓越的能力,同时在多种情感状态下保持高质量的视觉效果和运动真实性。

关键词

引用

@article{arxiv.2603.06071,
  title  = {Text-Driven Emotionally Continuous Talking Face Generation},
  author = {Hao Yang and Yanyan Zhao and Tian Zheng and Hongbo Zhang and Bichen Wang and Di Wu and Xing Fu and Xuda Zhi and Yongbo Huang and Hao He},
  journal= {arXiv preprint arXiv:2603.06071},
  year   = {2026}
}