中文

从视频参考生成你的说话头像

计算机视觉与模式识别 2026-05-01 v1

摘要

现有的说话头像方法通常采用以静态参考图像为条件的图像到视频生成流程,且该参考图像需与目标生成场景相同。这种受限的单视角视角缺乏足够的时间和表情线索,限制了在自定义背景中合成高保真说话头像的能力。为此,我们提出了基于视频参考的说话头像生成(TAVR)框架,这是一种通过利用跨场景视频输入来转变范式的新颖框架。为了有效处理这些扩展的时间上下文并弥合跨场景域差距,TAVR 集成了一个令牌选择模块以及一个全面的三阶段训练方案。具体来说,同场景视频预训练建立了基础的外观复制能力,随后通过跨场景参考微调进行扩展,以实现鲁棒的跨场景适应。最后,任务特定的强化学习将生成输出与基于身份的奖励对齐,以最大化身份相似度。为了系统地评估跨场景鲁棒性,我们构建了一个包含 158 对精心挑选的跨场景视频对的新基准。大量实验表明,TAVR 受益于灵活的推理时视频参考,并在定量和定性评估上均持续超越现有基线。这项工作已部署到生产环境中。更多相关研究,请访问 \href{https://www.heygen.com/research}{HeyGen Research} 和 \href{https://www.heygen.com/research/avatar-v-model}{HeyGen Avatar-V}。

关键词

引用

@article{arxiv.2604.27918,
  title  = {Generate Your Talking Avatar from Video Reference},
  author = {Zujin Guo and Zhenhui Ye and Yi Ren and Yuanming Li and Ce Chen and Zhibin Hong and Chen Change Loy},
  journal= {arXiv preprint arXiv:2604.27918},
  year   = {2026}
}

备注

Project Page: https://gseancdat.github.io/projects/TAVR