中文

FluentAvatar:基于音素引导的自回归说话头动画

计算机视觉与模式识别 2026-04-22 v3

摘要

当前的说话头生成方法逐渐从 GAN-based 方法转向基于扩散的范式, 在视觉保真度和时序一致性方面取得了显著进展。然而,现有基于扩散的方法中仍存在显著的帧间闪烁。一个重要原因是随机初始化导致的去噪轨迹变化留下了残余的帧间不一致性,这表现为相邻帧之间的短期突变视觉波动。为进一步验证这一点,我们通过固定输入仅改变随机种子进行控制实验。结果显示,不同抽样之间的闪烁模式差异显著,平均跨种子 Pearson 相关系数仅为 r = 0.15。这促使我们探索自回归生成方法,该方法按序建模帧,为时序连续性提供更直接的先验。基于此,我们提出 FluentAvatar,一个基于音素表示构建的两阶段自回归框架。首先,面部关键帧生成在音素对齐关键帧下,基于音素-帧因果注意力掩码生成;其次,inter-frame 插值通过基于选择性时序建模的 timestamp-aware 自适应策略合成过渡帧。此外,我们引入 BG-Flicker,一种针对说话头视频的背景隔离指标,能够更可靠地评估帧间闪烁。在 CMLR 和 HDTF 数据集上的实验表明,FluentAvatar 在视觉保真度、唇部同步和时序稳定性方面表现优异,两数据集上的 FVD 指标最佳,BG-Flicker 结果接近 ground truth。代码、模型和界面将公开,以促进进一步的研究。

关键词

引用

@article{arxiv.2509.12052,
  title  = {FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling},
  author = {Yuchen Deng and Xiuyang Wu and Hai-Tao Zheng and Suiyang Zhang and Yi He and Yuxing Han},
  journal= {arXiv preprint arXiv:2509.12052},
  year   = {2026}
}