记忆模块作为说话人脸生成中一对多映射的缓解器
计算机视觉与模式识别
2024-12-06 v4 多媒体
摘要
说话人脸生成旨在由输入音频驱动生成目标人物的照片级真实视频肖像。由于其从输入音频到输出视频存在一对多映射的特性(例如,一段语音内容可能有多种可行的视觉外观),像以往工作那样学习确定性映射会在训练时引入歧义,从而导致较差的视觉结果。尽管这种一对多映射可通过两阶段框架(即音频到表情模型后接神经渲染模型)得到部分缓解,但由于预测是在信息不足(如情绪、皱纹等)的情况下产生的,仍不够充分。在本文中,我们提出 MemFace,通过分别契合两阶段思路的隐式记忆与显式记忆来补充缺失信息。更具体地,隐式记忆用于音频到表情模型以捕捉音频-表情共享空间中的高层语义,而显式记忆用于神经渲染模型以帮助合成像素级细节。我们的实验结果表明,我们所提出的 MemFace 在多种场景下一致且显著地超越了所有最先进(SOTA)结果。
引用
@article{arxiv.2212.05005,
title = {Memories are One-to-Many Mapping Alleviators in Talking Face Generation},
author = {Anni Tang and Tianyu He and Xu Tan and Jun Ling and Li Song},
journal= {arXiv preprint arXiv:2212.05005},
year = {2024}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence (2024). Project page: see https://memoryface.github.io