驯服 Transformer 实现情绪可控的说话人脸生成
计算机视觉与模式识别
2025-08-21 v1
摘要
说话人脸生成是一项新颖且具有挑战性的生成任务,旨在根据给定的特定音频合成生动的说话人脸视频。为实现情绪可控的说话人脸生成,当前方法需要克服两个挑战:一是如何有效建模与特定情绪相关的多模态关系,二是如何利用这种关系合成保持身份的情绪化视频。在本文中,我们提出一种新颖的方法来离散地处理情绪可控的说话人脸生成任务。具体来说,我们采用两种预训练策略将音频解耦为独立成分,并将视频量化为视觉词元的组合。随后,我们提出情绪锚点(EA)表示,将情绪信息整合到视觉词元中。最后,我们引入一个自回归 Transformer 来建模给定条件下视觉词元的全局分布,并进一步预测索引序列以合成操控后的视频。我们在 MEAD 数据集上进行了实验,该数据集以多种情绪音频为条件控制视频的情绪。大量实验定性和定量地证明了我们方法的优越性。
引用
@article{arxiv.2508.14359,
title = {Taming Transformer for Emotion-Controllable Talking Face Generation},
author = {Ziqi Zhang and Cheng Deng},
journal= {arXiv preprint arXiv:2508.14359},
year = {2025}
}