学习时空相干相关性以实现保留语音的面部表情操纵
计算机视觉与模式识别
2026-04-23 v1
摘要
保留语音的面部表情操纵 (SPFEM) 旨在修改面部情绪,同时精心保持与说话内容相关的嘴部动画。当前的工作依赖于该人物难以获取的成对训练样本,其中两个对齐的帧展现相同的语音内容但情感表达不同,这限制了 SPFEM 在现实场景中的应用。在这项工作中,我们发现以不同情感传达相同内容的说话者在空间和时间空间上都表现出高度相关的局部面部动画,这为 SPFEM 提供了宝贵的监督。为了利用这一见解,我们提出了一种新颖的时空相干相关性学习 (STCCL) 算法,该算法将上述相关性建模为显式度量,并整合这些度量来监督面部表情的操纵,同时更好地保留说话内容的面部动画。为此,它首先学习一个空间相干相关性度量,确保与特定情感关联的图像内相邻局部区域的视觉相关性,与关联不同情感的图像中对应区域的视觉相关性高度相似。同时,它开发了一个时间相干相关性度量,确保与一种情感关联的相邻图像帧中特定区域的视觉相关性,与关联另一种情感的帧中对应区域的视觉相关性相似。认识到视觉相关性并非在所有区域都均匀一致,我们还设计了一种相关性感知的自适应策略,优先处理那些挑战更大的区域。在 SPFEM 模型训练期间,我们构建输入和输出图像帧对应局部区域之间的时空相干相关性度量,作为额外的损失来监督生成过程。
引用
@article{arxiv.2604.20226,
title = {Learning Spatial-Temporal Coherent Correlations for Speech-Preserving Facial Expression Manipulation},
author = {Tianshui Chen and Jianman Lin and Zhijing Yang and Chunmei Qing and Guangrun Wang and Liang Lin},
journal= {arXiv preprint arXiv:2604.20226},
year = {2026}
}