中文

EAD-Net:基于空间细化与时间一致性的情感感知说话人头生成

计算机视觉与模式识别 2026-04-28 v1 人工智能 图像与视频处理

摘要

情感化说话人头视频生成旨在生成具有准确唇形同步与情感面部表情的肖像视频。当前方法依赖简单情感标签,导致语义信息不足。虽然引入高层语义可提升表达性,但容易引发唇同步性能力下降。此外,主流生成方法在长视频中难以平衡计算效率与全局运动感知,且存在时间一致性差的问题。因此,我们提出一种基于情感-同步-扩散模型的网络结构,称为EAD-Net (Emotion-Aware Diffusion-based network)。我们引入SyncNet监督和时空表示对齐 (Temporal Representation Alignment, TREPA) 以缓解多模态融合导致的唇同步性能力下降。为建模长视频序列中的复杂时空依赖,本文提出一种时空方向注意力机制 (Spatio-Temporal Directional Attention, STDA),通过条带注意力捕获全局运动模式。此外,我们设计了时序帧图谱推理模块 (Temporal Frame graph Reasoning Module, TFRM),通过图结构学习显式建模视频帧之间的时间一致性。为增强情感语义控制,我们采用大语言模型从真实视频中提取文本描述,作为高层语义指导。实验在HDTF和MEAD数据集上表明,我们的方法在唇同步精度、时间一致性和情感精度方面均优于现有方法。

关键词

引用

@article{arxiv.2604.23325,
  title  = {EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence},
  author = {Yahui Li and Yinfeng Yu and Liejun Wang and Shengjie Shen},
  journal= {arXiv preprint arXiv:2604.23325},
  year   = {2026}
}

备注

Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026