中文

FREAK:频调高保真实时音频驱动说话肖像合成

计算机视觉与模式识别 2025-04-24 v2

摘要

在音频驱动的说话肖像合成中实现高保真唇语同步仍然具有挑战性。虽然多阶段流水线或扩散模型能产生高质量结果,但它们计算成本高昂。一些方法在特定个体上表现良好且资源需求低,但唇动仍存在不匹配。上述方法均在像素域建模。我们观察到合成说话视频与自然视频在频域中存在明显差异。目前,尚无说话肖像合成研究考虑这一方面。为解决此问题,我们提出了一种频域视角建模说话肖像的框架——FREAK(FREquency-modulated, high-fidelity, and real-time Audio-driven talKing portrait synthesis),提升了合成肖像的保真度与自然度。FREAK引入了两种新颖的频域模块:1)视觉编码频率调制器(VEFM),用于在频域中耦合多尺度视觉特征,更好地保留视觉频域信息并缩小合成帧与自然帧之间的频谱差距;2)音频视觉频率调制器(AVFM),帮助模型在频域中学习说话模式并改善音视频同步。此外,我们在像素域和频域联合优化模型。此外,FREAK支持在单次拍摄与视频配音设置之间无缝切换,提供增强的灵活性。由于其优越性能,它可同时支持高分辨率视频结果与实时推理。大量实验表明,我们的方法以实时方式合成具有精细面部纹理和精确唇语同步的高保真说话肖像,超越了最先进方法。

关键词

引用

@article{arxiv.2503.04067,
  title  = {FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait Synthesis},
  author = {Ziqi Ni and Ao Fu and Yi Zhou},
  journal= {arXiv preprint arXiv:2503.04067},
  year   = {2025}
}

备注

Accepted by ICMR 2025