中文

基于音频感知的风格参考实现风格保持的唇形同步

计算机视觉与模式识别 2025-06-19 v2 人工智能 多媒体

摘要

音频驱动的唇形同步最近因其在多媒体领域的广泛应用而引起广泛关注。个体在说同一句话时会呈现出不同的唇形,归因于其独特的说话风格,为音频驱动的唇形同步带来了显著挑战。此前针对此类任务的方法往往忽略了个人化说话风格的建模,导致唇形同步结果不符合实际的通用风格。最近的唇形同步技术尝试通过聚合风格参考视频中的信息来指导针对任意音频的唇形同步,但无法很好地保持说话风格 due to their inaccurate style aggregation. 本文提出一种创新的音频感知风格参考方案,通过有效利用输入音频与风格参考视频中参考音频之间的关系,解决了风格保持的音频驱动唇形同步问题。具体而言,我们首先开发了一个基于Transformer的高级模型,能够预测与输入音频对应的唇动,同时通过来自风格参考视频中跨注意力层聚合的风格信息进行增强。随后,为更好地将唇动渲染为逼真的说话人脸视频,我们设计了一个条件式潜在扩散模型,通过调制卷积层整合唇动,并通过空间跨注意力层融合参考人脸图像。大量实验验证了所提出方法在实现精准唇形同步、保持说话风格以及生成高保真逼真说话人脸视频方面的有效性。

关键词

引用

@article{arxiv.2408.05412,
  title  = {Style-Preserving Lip Sync via Audio-Aware Style Reference},
  author = {Weizhi Zhong and Jichang Li and Yinqi Cai and Ming Li and Feng Gao and Liang Lin and Guanbin Li},
  journal= {arXiv preprint arXiv:2408.05412},
  year   = {2025}
}

备注

submitted to IEEE Transactions on Multimedia(TMM)