中文

IP-Adapter 即可:面向无需微调的扩散模型基口播脸生成

计算机视觉与模式识别 2026-05-29 v1

摘要

随着扩散模型的快速发展,口播脸生成取得了显著进展。然而,现有扩散方法仍需任务特定微调和大规模音视频数据集,导致高计算成本,阻碍了扩散方法在研究社区中的可扩展性和可及性。为此,我们提出一种无需微调的范式,直接使用预训练的 Stable Diffusion 和 IP-Adapter 权重进行口播脸生成。该骨架网络利用 IP-Adapter 的视觉嵌入能力,从预训练的 Stable Diffusion 中挖掘唇部相关语义。为解决身份漂移、同步错误和时间不稳定等挑战,我们还设计了三个无需训练参数的组件:(1)Structurist,它显式解耦并重组唇部和外观特征,以缓解身份漂移和外观失真;(2)Structure Controller,它基于准单调运动趋势自适应细化嵌入,以实现精确唇部同步;(3)Noise Sensor,它引入高斯先验以检测并抑制闪烁和抖动伪影,增强时间一致性。实验结果表明,我们的方法在唇同步准确性(PCLD 提升至少 0.16)和视觉保真度(FID 提升至少 0.7)方面均优于现有 SOTA 方法,建立了一个面向口播脸生成的新型无需微调扩散框架。

关键词

引用

@article{arxiv.2605.30230,
  title  = {IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation},
  author = {Hao Wu and Xiangyang Luo and Hao Wang and Jiawei Zhang and Yi Zhang and Jinwei Wang},
  journal= {arXiv preprint arXiv:2605.30230},
  year   = {2026}
}