中文

跨模态情感迁移:用于说话人视频情感编辑

计算机视觉与模式识别 2026-04-20 v2 机器学习

摘要

说话人视频生成因其作为生成模型的核心应用而受到广泛关注。为了提高合成视频的表达性和真实性,情感编辑在说话人视频中的作用至关重要。然而,现有方法往往限制了表达的灵活性,难以生成扩展情感。基于标签的方法将情感用离散类别表示,无法捕捉广泛的情感范围。音频方法可以利用情感丰富的语音信号——甚至从情感化文本转语音(TTS)合成中受益——但由于情感与语言内容在情感语音中被 entangled,无法表达目标情感。图像方法则依赖目标参考图像来指导情感迁移,但需要高质量的正面视角,且在获取扩展情感(如讽刺)参考数据时面临挑战。为解决这些限制,我们提出了跨模态情感迁移(Cross-Modal Emotion Transfer, C-MET),一种新方法,通过建模情感语义向量来实现语音与视觉特征空间之间的情感语义,从而基于语音生成面部表情。C-MET利用大规模预训练音频编码器和解缠解 facial expression 编码器,学习表示跨模态不同情感嵌入之间差异的情感语义向量。在MEAD和CREMA-D数据集上进行的大量实验表明,我们的方法在情感准确率上比最先进的方法提高了14%,同时能够生成具有表现力的说话人视频,甚至能为未见的扩展情感生成。代码、模型权重和演示可在 https://chanhyeok-choi.github.io/C-MET/ 获取。

关键词

引用

@article{arxiv.2604.07786,
  title  = {Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video},
  author = {Chanhyuk Choi and Taesoo Kim and Donggyu Lee and Siyeol Jung and Taehwan Kim},
  journal= {arXiv preprint arXiv:2604.07786},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project Page: https://chanhyeok-choi.github.io/C-MET/