零样态高保真度可控姿态角色动画
计算机视觉与模式识别
2024-06-06 v3 人工智能
摘要
图像到视频 (I2V) 生成旨在从单张图像创建视频序列,这需要高的时间一致性和视觉保真度。然而,现有方法存在角色外观不一致性和细节保存不足的问题。此外,它们需要大量视频数据进行训练,这在计算上具有较高的要求。为解决这些限制,我们提出了 PoseAnimate,这是一个用于角色动画的零样态 I2V 框架。PoseAnimate 包含三个关键组件:1) 一个姿态感知控制模块 (PACM),将多样化的姿态信号整合到文本嵌入中,以保留角色无关的内容并维持动作的精确对齐。2) 一个双一致性注意力模块 (DCAM),增强时间一致性,同时保留角色身份和精细背景细节。3) 一个掩码引导的解耦模块 (MGDM),提升特征感知能力,通过解耦角色和背景来提高动画保真度。我们还提出了姿态对齐过渡算法 (PATA),以确保动作转换的平滑。大量实验结果表明,我们的方法在角色一致性和细节保真度方面优于基于训练的方法,同时在生成动画的整个过程中保持了较高的时间一致性水平。
引用
@article{arxiv.2404.13680,
title = {Zero-shot High-fidelity and Pose-controllable Character Animation},
author = {Bingwen Zhu and Fanyi Wang and Tianyi Lu and Peng Liu and Jingwen Su and Jinxiu Liu and Yanhao Zhang and Zuxuan Wu and Guo-Jun Qi and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2404.13680},
year = {2024}
}
备注
10 pages, 5 figures