中文

OpFlowTalker:基于光流引导的逼真自然说话人脸生成

计算机视觉与模式识别 2024-05-29 v2 多媒体

摘要

创建逼真、自然且唇读可懂的人脸说话视频仍然是一项艰巨的挑战。以往研究主要集中于生成和对齐单帧图像,而忽略了帧间过渡的平滑性和时间依赖性。这常常损害实际场景中的视觉质量和效果,特别是在处理复杂面部数据和音频内容时,经常导致语义不一致的视觉错觉。具体来说,合成视频通常出现混乱的嘴唇运动,使其难以理解和识别。为了克服这些限制,本文引入光流来指导面部图像生成,增强帧间连续性和语义一致性。我们提出"OpFlowTalker",一种新颖的方法,利用从音频输入预测的光流变化而非直接图像预测。该方法平滑图像过渡并使变化与语义内容对齐。此外,它采用序列融合技术替代单帧的独立生成,从而保留上下文信息并维持时间连贯性。我们还开发了一个光流同步模块,调节全脸和嘴唇运动,通过平衡区域动态优化视觉合成。此外,我们引入视觉文本一致性分数(VTCS),准确衡量合成视频中的唇读可懂度。大量实证验证了我们方法的有效性。

关键词

引用

@article{arxiv.2405.14709,
  title  = {OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance},
  author = {Shuheng Ge and Haoyu Xing and Li Zhang and Xiangqian Wu},
  journal= {arXiv preprint arXiv:2405.14709},
  year   = {2024}
}