ATL-Diff:基于早期关键点引导的音频驱动说话人头生成
计算机视觉与模式识别
2025-07-18 v1
摘要
音频驱动的说话人头生成要求面部动画与音频信号实现精确同步。本文介绍 ATL-Diff,一种新方法,旨在解决同步性限制问题,同时降低噪声和计算成本。我们的框架包含三个关键组件:一个将音频转换为面部关键点的数字生成模块、一种利用关键点分布噪声的引导方法,以实现音频解耦,以及一个保持身份特征的 3D 身份扩散网络。在 MEAD 和 CREMA-D 数据集上的实验表明,ATL-Diff 在所有指标上均优于最先进的方法。我们的 approach 实现了近实时处理,具有高质量动画、计算效率和对面部细微特征的卓越保留。这一突破为虚拟助手、教育、医疗沟通及数字平台等应用提供了广阔前景。源代码可在 \href{https://github.com/sonvth/ATL-Diff}{https://github.com/sonvth/ATL-Diff} 获取。
引用
@article{arxiv.2507.12804,
title = {ATL-Diff: Audio-Driven Talking Head Generation with Early Landmarks-Guide Noise Diffusion},
author = {Hoang-Son Vo and Quang-Vinh Nguyen and Seungwon Kim and Hyung-Jeong Yang and Soonja Yeom and Soo-Hyung Kim},
journal= {arXiv preprint arXiv:2507.12804},
year = {2025}
}