思考后绘制:情感语义分解与可控情绪化说话人生成
计算机视觉与模式识别
2025-07-18 v1 人工智能
摘要
情感化说话人生成已成为计算机视觉与多模态人工智能交叉领域的关键研究方向,其核心价值在于通过沉浸式和同情的互动提升人机交互体验。随着多模态大型语言模型的发展,情感化说话人生成的驱动信号从音频和视频转向更灵活的文本。然而,当前基于文本的方法依赖预定义的离散情感标签文本,过度简化了真实面部肌肉运动的动态复杂性,无法实现自然的情感表达。本研究提出了“思考后绘制”框架,以解决两个关键挑战:(1)情感语义深入解析——创新性地引入链式思考(CoT),将抽象情感标签转化为以生理学为依据的面部肌肉运动描述,实现从高层语义到可操作运动特征的映射;(2)细粒度表达优化——灵感来自艺术家的肖像绘画过程,提出渐进引导去噪策略,采用“全局情感局部肌肉控制”机制,对生成视频中的微表情动态进行细化。我们的实验表明,在广泛使用的基准数据集(包括MEAD和HDTF)上,该方法实现了最先进的性能。此外,我们收集了一组肖像图像,以评估模型的零样本生成能力。
引用
@article{arxiv.2507.12761,
title = {Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation},
author = {Hanlei Shi and Leyuan Qu and Yu Liu and Di Gao and Yuhua Zheng and Taihao Li},
journal= {arXiv preprint arXiv:2507.12761},
year = {2025}
}