中文

ATL-Diff:基于早期关键点引导的音频驱动说话人头生成

计算机视觉与模式识别 2025-07-18 v1

摘要

音频驱动的说话人头生成要求面部动画与音频信号实现精确同步。本文介绍 ATL-Diff,一种新方法,旨在解决同步性限制问题,同时降低噪声和计算成本。我们的框架包含三个关键组件:一个将音频转换为面部关键点的数字生成模块、一种利用关键点分布噪声的引导方法,以实现音频解耦,以及一个保持身份特征的 3D 身份扩散网络。在 MEAD 和 CREMA-D 数据集上的实验表明,ATL-Diff 在所有指标上均优于最先进的方法。我们的 approach 实现了近实时处理,具有高质量动画、计算效率和对面部细微特征的卓越保留。这一突破为虚拟助手、教育、医疗沟通及数字平台等应用提供了广阔前景。源代码可在 \href{https://github.com/sonvth/ATL-Diff}{https://github.com/sonvth/ATL-Diff} 获取。

关键词

引用

@article{arxiv.2507.12804,
  title  = {ATL-Diff: Audio-Driven Talking Head Generation with Early Landmarks-Guide Noise Diffusion},
  author = {Hoang-Son Vo and Quang-Vinh Nguyen and Seungwon Kim and Hyung-Jeong Yang and Soonja Yeom and Soo-Hyung Kim},
  journal= {arXiv preprint arXiv:2507.12804},
  year   = {2025}
}