面向情感连续的文本驱动式说话人脸生成
计算机视觉与模式识别
2026-03-09 v1 人工智能
摘要
说话人脸生成(TFG)旨在创建逼真且情感丰富的数字面孔。虽然前期 TFG 工作已掌握了自然面部运动的生成,但它们通常表现出固定的目标情感,缺乏类似人类在传递信息时所展现的持续变化和自然的表情能力。为生成逼真视频,我们提出了一种新任务,即情感连续说话人脸生成(EC-TFG),该任务以文本段落和带有情感变化描述的情感信息为驱动数据,旨在生成视频 wherein person 说话文本,同时反映描述中所包含的情感变化。同时,我们引入了定制模型,即时重点情感调制说话人脸生成(TIE-TFG),该模型创新性地通过采用时序强化情感涨落建模(Temporal-Intensive Emotion Fluctuation Modeling),允许其为输入文本提供情感变化序列,从而驱动合成视频中面部表情的连续变化。广泛的评估表明,我们的方法在制造平滑情感转换方面具有卓越的能力,同时在多种情感状态下保持高质量的视觉效果和运动真实性。
引用
@article{arxiv.2603.06071,
title = {Text-Driven Emotionally Continuous Talking Face Generation},
author = {Hao Yang and Yanyan Zhao and Tian Zheng and Hongbo Zhang and Bichen Wang and Di Wu and Xing Fu and Xuda Zhi and Yongbo Huang and Hao He},
journal= {arXiv preprint arXiv:2603.06071},
year = {2026}
}