SkyReels-A1:基于视频扩散 Transformer 的表达化肖像动画
计算机视觉与模式识别
2025-02-18 v1
摘要
我们提出了 SkyReels-A1,一个基于视频扩散 Transformer 构建的简单而有效的框架,用于促进肖像图像动画。现有方法仍存在身份失真、背景不稳定和不真实面部动态等问题,尤其在仅进行头部动画的情况下更为突出。此外,扩展以 accommodate 多样化身体比例通常会导致视觉不一致或不自然的关节动作。为解决这些挑战,SkyReels-A1 利用了视频 DiT 的强大生成能力,增强了面部运动传递精度、身份保留和时间一致性。该系统包含一个表达感知条件模块,使其能够通过表达引导的地标输入驱动无缝视频合成。集成面部图像-文本对齐模块强化了面部属性与运动轨迹的融合,从而加强了身份保留。此外,SkyReels-A1 包含一个多阶段训练范例,用于逐步细化表达与运动之间的关联,同时确保身份再现的稳定性。大量经验评估表明,该模型能够产生视觉上连贯且构图多样的结果,非常适用于虚拟头像、远程沟通和数字媒体生成等领域。
引用
@article{arxiv.2502.10841,
title = {SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers},
author = {Di Qiu and Zhengcong Fei and Rui Wang and Jialin Bai and Changqian Yu and Mingyuan Fan and Guibin Chen and Xiang Wen},
journal= {arXiv preprint arXiv:2502.10841},
year = {2025}
}