EmoCAST:基于情感文本描述的情感说话人物轮廓
计算机视觉与模式识别
2025-12-24 v2
摘要
情感说话人物合成旨在生成具有丰富情感表达的说话人物视频。现有方法在控制灵活性、动作自然性和情感质量方面仍存在局限。此外,当前可用的 datasets 主要在实验室环境中收集,进一步恶化了这些局限,阻碍了实际应用。为此,我们提出 EmoCAST,一个基于扩散模型的说话人物框架,实现精准的、文本驱动的情感合成。其贡献体现在三方面:(1)能够有效控制文本的架构模块;(2)扩充框架能力的情感说话人物 dataset;(3)进一步提升性能的训练策略。具体而言,针对外观建模,情感提示通过文本引导的情感注意力模块集成,增强空间知识以提高情感理解。为强化音频与情感的对齐,我们引入情感音频注意力模块以捕捉受控情感与驱动音频之间的相互作用,生成情感感知特征以指导精确的面部动作合成。此外,我们构建了一个大规模的野外情感说话人物 dataset,包含情感文本描述,以优化框架性能。基于该 dataset,我们提出情感感知采样策略和渐进式功能训练策略,提高模型捕捉细腻表达特征的能力,实现精准的唇音同步。总体而言,EmoCAST 在生成真实、情感丰富且音频同步的说话人物视频方面实现了最先进的性能。项目页面:https://github.com/GVCLab/EmoCAST
引用
@article{arxiv.2508.20615,
title = {EmoCAST: Emotional Talking Portrait via Emotive Text Description},
author = {Yiguo Jiang and Xiaodong Cun and Yong Zhang and Yudian Zheng and Fan Tang and Chi-Man Pun},
journal= {arXiv preprint arXiv:2508.20615},
year = {2025}
}