中文

基于StyleGAN的音频驱动高分辨率无缝说话人视频编辑

计算机视觉与模式识别 2024-07-09 v1

摘要

现有的音频驱动说话人视频编辑方法存在视觉效果不佳的局限性。本文尝试通过基于两个模块编辑带有不同情感的说话人脸图像来无缝地解决这个问题:(1)一个音频到地标模块,由交叉重构情感解耦和一个对齐网络模块组成。它通过从语音中预测相应的情感地标来弥合语音和面部运动之间的差距;(2)一个基于地标的编辑模块,通过StyleGAN编辑人脸视频。它旨在生成由输入音频中的情感和内容成分组成的无缝编辑视频。大量实验证实,与最先进的方法相比,我们的方法提供了具有高视觉质量的高分辨率视频。

关键词

引用

@article{arxiv.2407.05577,
  title  = {Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN},
  author = {Jiacheng Su and Kunhong Liu and Liyan Chen and Junfeng Yao and Qingsong Liu and Dongdong Lv},
  journal= {arXiv preprint arXiv:2407.05577},
  year   = {2024}
}