中文

基于测试时自适应条件的稳定音频驱动说话头生成

计算机视觉与模式识别 2026-05-26 v1 人工智能 多媒体

摘要

音频驱动的说话头生成方法近期如 AniTalker、FLOAT 和 Sonic 等模型取得了显著进展。尽管这些方法取得了成功,但大多数现有方法在推理阶段依赖单一静态参考图像来条件化整个视频生成过程。这种静态条件化范式常常导致固定身份特征与动态演化面部运动之间的不匹配,引发身份漂移、时间不一致和感知质量下降。我们提出了测试时自适应条件化 (TT-SAC), 一个无需重新训练、梯度更新或额外监督即可使预训练的说话头生成器在推理过程中自适应其条件表示的无参数推理框架。 TT-SAC 不将参考肖像视为不可变对象,而是将生成器与其编码器组合成反馈环路: 生成器的输出被重新编码以构建更符合合成序列时间动态的细化条件表示。单个适应步骤可近似等于生成过程的自洽平衡,从而在时间上稳定身份和运动。我们进一步在轻微 Lipschitz 假设下提供了理论分析,表明测试时条件化适应可减少特征方差并提高生成稳定性,同时呈现一种原则性的偏差-方差博弈以决定适应强度的最优值。在最先进的说话头生成器和基准数据集上的大量实验表明, TT-SAC 在唇部同步准确性、时间一致性、身份保持和感知保真度方面均实现了持续的改进。 TT-SAC 提供了一种模型无关且无需训练的策略,用于增强生成式视频模型,确立了测试时条件化适应作为稳定音频驱动肖像动画的有效机制。

关键词

引用

@article{arxiv.2605.25488,
  title  = {Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation},
  author = {Zhicheng Zhang and Lei Wang and Yu Zhang and Yongsheng Gao},
  journal= {arXiv preprint arXiv:2605.25488},
  year   = {2026}
}

备注

Research report