OpFlowTalker:基于光流引导的逼真自然说话人脸生成
计算机视觉与模式识别
2024-05-29 v2 多媒体
摘要
创建逼真、自然且唇读可懂的人脸说话视频仍然是一项艰巨的挑战。以往研究主要集中于生成和对齐单帧图像,而忽略了帧间过渡的平滑性和时间依赖性。这常常损害实际场景中的视觉质量和效果,特别是在处理复杂面部数据和音频内容时,经常导致语义不一致的视觉错觉。具体来说,合成视频通常出现混乱的嘴唇运动,使其难以理解和识别。为了克服这些限制,本文引入光流来指导面部图像生成,增强帧间连续性和语义一致性。我们提出"OpFlowTalker",一种新颖的方法,利用从音频输入预测的光流变化而非直接图像预测。该方法平滑图像过渡并使变化与语义内容对齐。此外,它采用序列融合技术替代单帧的独立生成,从而保留上下文信息并维持时间连贯性。我们还开发了一个光流同步模块,调节全脸和嘴唇运动,通过平衡区域动态优化视觉合成。此外,我们引入视觉文本一致性分数(VTCS),准确衡量合成视频中的唇读可懂度。大量实证验证了我们方法的有效性。
引用
@article{arxiv.2405.14709,
title = {OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance},
author = {Shuheng Ge and Haoyu Xing and Li Zhang and Xiangqian Wu},
journal= {arXiv preprint arXiv:2405.14709},
year = {2024}
}