中文

基于Gaze-oriented和Highly Disentangled的肖像动画生成:节奏姿态与真实表情

高能物理 - 理论 2025-04-23 v2 统计力学 高能物理 - 格点

摘要

音频驱动的说话头生成需要在多样化输入肖像和复杂的音频与面部动作关联性之间实现数据融合。为此,我们提出 robust 框架GoHD,旨在从任意参考身份中生成高度真实、具表现力且可控的肖像视频。GoHD创新性地包含三个关键模块:首先,引入基于潜在导航的动画模块,以提升跨 unseen 输入风格的泛化能力。该模块实现了动作与身份的高度解耦,并纠正了以往忽视的眼动问题。其次,设计符合构体结构的条件扩散模型,确保头部姿态具备韵律感。最后,为在有限训练数据下从输入音频估计同步且真实的表情,我们设计了两阶段训练策略,将频繁且帧级的唇部动作蒸馏与生成其他更依赖时间的但较少与音频相关的动作(如眨眼、皱眉)解耦。广泛实验表明,GoHD在生成任意主体的真实说话面部结果方面展现出先进的泛化能力。

关键词

引用

@article{arxiv.2412.09295,
  title  = {Testing the RG-flow $M(3,10)+\phi_{1,7}\to M(3,8)$ with Hamiltonian Truncation},
  author = {Olivier Delouche and Joan Elias Miro and James Ingoldby},
  journal= {arXiv preprint arXiv:2412.09295},
  year   = {2025}
}

备注

46 pages, 6 figures and 6 tables. Typos in some derivations corrected