中文

FlowPortrait:基于强化学习的音频驱动肖像视频生成

计算机视觉与模式识别 2026-03-03 v1 人工智能 多媒体 声音

摘要

生成逼真的说话头像视频仍然具有挑战性,主要问题包括唇部同步不完美、运动不自然以及与人类感知不良相关的评估指标。我们提出FlowPortrait,一个基于多模态 backbone 的音频驱动肖像动画强化学习框架,用于自回归音频到视频生成。FlowPortrait 引入基于多模态大型语言模型(MLLMs)的人类对齐评估系统,用于评估唇部同步准确性、表达性和运动质量。这些信号与感知正则和时间一致性正则结合,以形成稳定的复合奖励,用于通过组相对策略优化(GRPO)后训练生成器。大量实验,包括自动评估和人类偏好研究,表明FlowPortrait consistently 能产生更高质量的说话头像视频,凸显了强化学习在肖像动画中的有效性。

关键词

引用

@article{arxiv.2603.00159,
  title  = {FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation},
  author = {Weiting Tan and Andy T. Liu and Ming Tu and Xinghua Qu and Philipp Koehn and Lu Lu},
  journal= {arXiv preprint arXiv:2603.00159},
  year   = {2026}
}