Takin-ADA:基于规范点和关键点损失优化的情感可控音频驱动动画
计算机视觉与模式识别
2024-10-21 v1
摘要
现有的音频驱动面部动画方法面临关键挑战,包括表情泄露、细微表情迁移效果不佳以及音频驱动同步不精确。我们发现这些问题源于运动表示的局限性以及对面部表情缺乏细粒度控制。为解决这些问题,我们提出了Takin-ADA,一种新颖的两阶段实时音频驱动肖像动画方法。在第一阶段,我们引入了一种专门的损失函数,该函数在减少不必要表情泄露的同时增强了细微表情的迁移。第二阶段利用先进的音频处理技术来提高唇形同步精度。我们的方法不仅能生成精确的唇部运动,还能灵活控制面部表情和头部运动。Takin-ADA在RTX 4090 GPU上能以高达42 FPS的帧率生成高分辨率(512x512)的面部动画,性能优于现有的商业解决方案。大量实验表明,我们的方法在视频质量、面部动态真实感和自然头部运动方面显著超越了先前的方法,为音频驱动面部动画领域树立了新的标杆。
引用
@article{arxiv.2410.14283,
title = {Takin-ADA: Emotion Controllable Audio-Driven Animation with Canonical and Landmark Loss Optimization},
author = {Bin Lin and Yanzhen Yu and Jianhao Ye and Ruitao Lv and Yuguang Yang and Ruoye Xie and Pan Yu and Hongbin Zhou},
journal= {arXiv preprint arXiv:2410.14283},
year = {2024}
}
备注
under review