中文

SynchroRaMa:基于多模态情感嵌入的唇同步与情感感知说话人脸生成

计算机视觉与模式识别 2025-09-25 v1

摘要

音频驱动的说话人脸生成已受到越来越多的关注,特别是在需要表达丰富且自然的人机交互的应用中。然而,大多数现有的情感感知方法依赖单一模态(音频或图像)进行情感嵌入,限制了其捕捉细微情感线索的能力。此外,大多数方法以单张参考图像为条件,限制了模型表示随时间变化的动作或属性的能力。为了解决这些问题,我们提出了 SynchroRaMa,一个新颖的框架,通过结合来自文本(通过情感分析)和音频(通过语音情感识别和音频衍生的效价-唤醒特征)的情感信号来集成多模态情感嵌入,从而生成具有更丰富和更真实情感表现力和保真度的说话人脸视频。为确保自然头部运动和精确唇同步,SynchroRaMa 包含一个音频到运动(A2M)模块,该模块生成与输入音频对齐的运动帧。最后,SynchroRaMa 纳入由大语言模型(LLM)生成的场景描述作为额外的文本输入,使其能够捕捉动态动作和高层语义属性。通过视觉和文本线索共同约束模型增强了时间一致性和视觉真实感。在基准数据集上的定量和定性实验表明 SynchroRaMa 优于最先进方法,在图像质量、表情保持和运动真实感方面取得了提升。一项用户研究进一步证实 SynchroRaMa 在整体自然度、运动多样性和视频流畅度方面比竞争方法获得了更高的主观评分。我们的项目页面位于 <https://novicemm.github.io/synchrorama>。

关键词

引用

@article{arxiv.2509.19965,
  title  = {SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding},
  author = {Phyo Thet Yee and Dimitrios Kollias and Sudeepta Mishra and Abhinav Dhall},
  journal= {arXiv preprint arXiv:2509.19965},
  year   = {2025}
}

备注

Accepted at WACV 2026, project page : https://novicemm.github.io/synchrorama