TCAN:基于扩散模型的用于人形图像动画的时序一致姿态引导
计算机视觉与模式识别
2024-07-15 v1 人工智能
摘要
姿态驱动的人形图像动画扩散模型在实现逼真的人形视频合成方面显示出卓越的能力。尽管已有方法取得了令人瞩目的成果,但仍面临在实现动画时序一致性以及确保对非专业姿态检测器的鲁健性方面的挑战。本文提出了TCAN(Temporally Consistent Animation Network),一种具备抗错误姿态鲁健性并在时间上保持一致性的人形图像动画方法。与先前方法不同,我们利用预训练的ControlNet而无需微调,以利用大量姿态-图像-描述三元组所获取的广泛知识。为维持ControlNet的冻结状态,我们采用LoRA技术对UNet层进行适配,使网络能够在姿态特征与外观特征的潜空间之间进行对齐。此外,我们引入额外的时序层以增强对姿态检测器异常值的鲁健性。通过对时序轴上注意力图的分析,我们设计了一种利用姿态信息的新型温度图,从而实现更静态的背景。广泛的实验结果表明,所提方法在涵盖各种姿态(如卡比)的视频合成任务中均能取得令人满意的成果。
关键词
引用
@article{arxiv.2407.09012,
title = {TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion Models},
author = {Jeongho Kim and Min-Jung Kim and Junsoo Lee and Jaegul Choo},
journal= {arXiv preprint arXiv:2407.09012},
year = {2024}
}
备注
The first two authors contributed equally