FlowPortrait:基于强化学习的音频驱动肖像视频生成
计算机视觉与模式识别
2026-03-03 v1 人工智能
多媒体
声音
摘要
生成逼真的说话头像视频仍然具有挑战性,主要问题包括唇部同步不完美、运动不自然以及与人类感知不良相关的评估指标。我们提出FlowPortrait,一个基于多模态 backbone 的音频驱动肖像动画强化学习框架,用于自回归音频到视频生成。FlowPortrait 引入基于多模态大型语言模型(MLLMs)的人类对齐评估系统,用于评估唇部同步准确性、表达性和运动质量。这些信号与感知正则和时间一致性正则结合,以形成稳定的复合奖励,用于通过组相对策略优化(GRPO)后训练生成器。大量实验,包括自动评估和人类偏好研究,表明FlowPortrait consistently 能产生更高质量的说话头像视频,凸显了强化学习在肖像动画中的有效性。
引用
@article{arxiv.2603.00159,
title = {FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation},
author = {Weiting Tan and Andy T. Liu and Ming Tu and Xinghua Qu and Philipp Koehn and Lu Lu},
journal= {arXiv preprint arXiv:2603.00159},
year = {2026}
}