DiTalker:基于统一DiT框架的高质量可控肖像动画
计算机视觉与模式识别
2025-08-12 v1
摘要
肖像动画旨在从静态参考面孔合成讲话视频,基于音频和风格帧线索(如情感和头部姿态),同时确保精确的lip同步和忠实的讲话风格再现。现有基于扩散的肖像动画方法主要关注lip同步或静态情感转换,常常忽视动态风格,如头部运动。此外,这些方法大多依赖双U-Net架构,虽保持身份一致性,但增加了额外的计算开销。为此,我们提出DiTalker,一个基于DiT的统一框架,用于可控肖像动画。我们设计了风格-情感编码模块,使用两个独立的分支:风格分支提取身份特定的风格信息(如头部姿态和运动),情感分支提取身份无关的情感特征。我们进一步引入了音频-风格融合模块,通过两个平行的跨注意力层解耦音频和讲话风格,这些特征用于指导动画过程。为提高结果质量,我们采用并修改了两个优化约束:一个改进lip同步,另一个保留细粒度身份和背景细节。大量实验表明,DiTalker在lip同步和讲话风格可控性方面均优于现有方法。项目页面:https://thenameishope.github.io/DiTalker/
引用
@article{arxiv.2508.06511,
title = {DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation},
author = {He Feng and Yongjia Ma and Donglin Di and Lei Fan and Tonghua Su and Xiangqian Wu},
journal= {arXiv preprint arXiv:2508.06511},
year = {2025}
}