中文

面向语境感知的说话人脸视频生成

计算机视觉与模式识别 2024-02-29 v1

摘要

本文提出一种新颖且实际的说话人脸视频生成情形。具体而言,我们聚焦于涉及多人交互的场景,其中包含观众或周围环境等说话语境。在此类情形下,视频生成应考虑语境,以便生成的内容能够与驱动音频自然匹配,并在空间上与语境保持一致。为实现此目标,我们提供了一个两阶段、跨模态可控的视频生成管线,采用面部关键点作为显式且紧凑的控制信号,以桥接驱动音频、说话语境与生成视频之间。值得注意的是,在该管线内部,我们设计了一个 3D 视频扩散模型,允许对空间条件(关键点和语境视频)以及音频条件进行高效扭曲,从而实现时间上的一致性。实验结果验证了所提方法在音频-视频同步性、视频保真度和帧一致性方面相较于其他基线方法具有优势。

关键词

引用

@article{arxiv.2402.18092,
  title  = {Context-aware Talking Face Video Generation},
  author = {Meidai Xuanyuan and Yuwang Wang and Honglei Guo and Qionghai Dai},
  journal= {arXiv preprint arXiv:2402.18092},
  year   = {2024}
}