DEMO:基于离散运动潜在流匹配的细粒度可控说话人肖像合成
计算机视觉与模式识别
2025-10-14 v1 人工智能
摘要
基于扩散生成模型的音频驱动说话人视频生成取得了快速进展,但要生成具有细粒度运动控制的时序连贯视频仍具有挑战性。我们提出了DEMO,这是一种用于音频驱动说话人肖像视频合成的流匹配生成框架,能够实现对唇部运动、头部姿态和眼神的解耦、高保真控制。核心贡献是构建一种运动自编码器,在其结构化潜在空间中独立表示运动因子并对其进行近似正交化。在这种解耦运动空间上,我们应用基于最优传输的流匹配方法,并结合变换器预测器,生成以音频为条件的时序平滑运动轨迹。广泛的实验结果表明,DEMO在视频真实性、唇音同步以及运动保真度方面均优于先前方法。这些结果表明, 将细粒度运动解耦与基于流的生成建模相结合,为可控说话人视频合成提供了一种强大的新范例。
引用
@article{arxiv.2510.10650,
title = {DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis},
author = {Peiyin Chen and Zhuowei Yang and Hui Feng and Sheng Jiang and Rui Yan},
journal= {arXiv preprint arXiv:2510.10650},
year = {2025}
}
备注
5 pages