中文

基于Transformer音视觉上下文利用的掩码唇形同步预测

计算机视觉与模式识别 2022-12-12 v1 人工智能 图形学

摘要

以往的研究探索了在给定音频条件下为任意目标生成精确唇形同步人脸的方法。然而,它们大多扭曲或生成整个面部区域,导致不真实的结果。在本工作中,我们深入探讨仅改变目标人物嘴部形状这一表述。这需要对原始图像的大部分进行掩码,并借助音频与参考帧无缝修复。为此,我们提出音视觉上下文感知Transformer (Audio-Visual Context-Aware Transformer, AV-CAT) 框架,通过预测被掩码的嘴形生成具有照片级真实质量的精确唇形同步。我们的核心见解是利用精心设计的Transformer充分挖掘音频与视觉模态所提供的所需上下文信息。具体而言,我们提出卷积-Transformer混合骨干网络,并设计基于注意力的融合策略以填充掩码部分。它统一关注未掩码区域的纹理信息与参考帧,随后语义音频信息被用于增强自注意力计算。此外,带音频注入的细化网络提升了图像与唇形同步质量。大量实验验证我们的模型能为任意对象生成高保真唇形同步结果。

关键词

引用

@article{arxiv.2212.04970,
  title  = {Masked Lip-Sync Prediction by Audio-Visual Contextual Exploitation in Transformers},
  author = {Yasheng Sun and Hang Zhou and Kaisiyuan Wang and Qianyi Wu and Zhibin Hong and Jingtuo Liu and Errui Ding and Jingdong Wang and Ziwei Liu and Hideki Koike},
  journal= {arXiv preprint arXiv:2212.04970},
  year   = {2022}
}

备注

Accepted to SIGGRAPH Asia 2022 (Conference Proceedings). Project page: https://hangz-nju-cuhk.github.io/projects/AV-CAT