中文

基于记忆共享与注意力增强网络的情感说话头生成

计算机视觉与模式识别 2023-06-07 v1

摘要

给定一段音频剪辑与一张参考人脸图像,说话头生成的目标是生成高保真说话头视频。尽管一些音频驱动的说话头视频生成方法在过去已取得一定成果,但它们大多仅关注唇形与音频同步,缺乏复现目标人物面部表情的能力。为此,我们提出一种由记忆共享情感特征提取器(MSEF)与基于 U-net 的注意力增强转换器(AATU)构成的说话头生成模型。首先,MSEF 可从音频中提取隐式情感辅助特征以估计更精确的情感人脸关键点。其次,AATU 充当估计关键点与照片级真实视频帧之间的转换器。大量定性与定量实验表明了所提方法相对于先前工作的优越性。代码将公开可用。

关键词

引用

@article{arxiv.2306.03594,
  title  = {Emotional Talking Head Generation based on Memory-Sharing and Attention-Augmented Networks},
  author = {Jianrong Wang and Yaxin Zhao and Li Liu and Tianyi Xu and Qi Li and Sen Li},
  journal= {arXiv preprint arXiv:2306.03594},
  year   = {2023}
}