中文

基于对比学习的解耦表征学习与正则化用于语音保持性人脸表情操纵

计算机视觉与模式识别 2025-04-09 v1 声音

摘要

语音保持性人脸表情操纵 (SPFEM) 旨在修改说话头像以显示特定参考情感,同时保持源语音内容的嘴部动画。因此,参考输入和源输入中存在的情感与内容信息可为 SPFEM 模型提供直接且准确的监督信号。然而,这些元素在说话过程中内在的交织性会限制其作为监督信号的有效性。本文提出通过创新的对比解耦表征学习 (CDRL) 算法学习内容与情感先验,以增强对比学习的方式学习解耦的内容与情感表征。具体而言,设计了对比内容表征学习 (CCRL) 模块,以学习主要包含内容信息的音频特征作为内容先验,指导从源输入学习内容表征。同时,提出对比情感表征学习 (CERL) 模块,以利用预训练的视觉-语言模型学习情感先验,然后用于指导从参考输入学习情感表征。我们进一步引入情感感知和情感增强对比学习,分别训练 CCRL 和 CERL 模块,确保学习情感独立的内容表征和内容独立的情感表征。在 SPFEM 模型训练期间,使用解耦的内容与情感表征来监督生成过程,确保更准确的情感操纵以及音频-唇部同步。广泛的实验和评估表明,所提出的算法在各种基准数据集上有效。

关键词

引用

@article{arxiv.2504.05672,
  title  = {Contrastive Decoupled Representation Learning and Regularization for Speech-Preserving Facial Expression Manipulation},
  author = {Tianshui Chen and Jianman Lin and Zhijing Yang and Chumei Qing and Yukai Shi and Liang Lin},
  journal= {arXiv preprint arXiv:2504.05672},
  year   = {2025}
}