面向音频驱动的说话人肖像的人形运动潜流匹配 (FLOAT)
计算机视觉与模式识别
2025-09-22 v5 人工智能
机器学习
多媒体
图像与视频处理
摘要
随着基于扩散的生成模型的快速发展,肖像图像动画已取得显著成果。然而,它仍面临在时序上保持一致性的视频生成以及快速采样的问题,由于其迭代采样的本质。本文提出了 FLOAT,一种基于流匹配生成模型的音频驱动说话人肖像视频生成方法。我们不采用基于像素的潜空间,而是利用学习到的正交运动潜空间,实现了高效的时序一致运动生成和编辑。为此,我们引入了具备有效帧级条件机制的基于 transformer 的向量场预测器。此外,我们的方法支持语音驱动的情感增强,实现了自然的情感动作融合。大量实验表明,我们的方法在视觉质量、运动保真度和效率方面均优于当前基于音频的说话人肖像方法。
引用
@article{arxiv.2412.01064,
title = {FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait},
author = {Taekyung Ki and Dongchan Min and Gyeongsu Chae},
journal= {arXiv preprint arXiv:2412.01064},
year = {2025}
}
备注
ICCV 2025. Project page: https://deepbrainai-research.github.io/float/