PIA:基于文本生成图像模型即插即用模块的个性化图像动画生成器
计算机视觉与模式识别
2024-03-26 v3 人工智能
摘要
个性化文本生成图像(T2I)模型的最新进展彻底改变了内容创作,使非专业人士能够生成具有独特风格的惊艳图像。尽管前景广阔,但通过文本为这些个性化图像添加逼真动作,在保持独特风格、高保真细节以及实现文本动作可控性方面面临重大挑战。本文提出 PIA,一种个性化图像动画生成器,擅长对齐条件图像,通过文本实现动作可控性,且无需特定微调即可兼容各种个性化 T2I 模型。为实现这些目标,PIA 构建于具备训练良好的时间对齐层的基础 T2I 模型之上,允许将任何个性化 T2I 模型无缝转换为图像动画模型。PIA 的关键组件是引入了条件模块,该模块利用条件帧和帧间亲和度作为输入,在隐空间中为单帧合成在亲和度提示的引导下传递外观信息。该设计缓解了外观相关图像对齐的挑战,并允许更专注于对齐动作相关的指导。
引用
@article{arxiv.2312.13964,
title = {PIA: Your Personalized Image Animator via Plug-and-Play Modules in Text-to-Image Models},
author = {Yiming Zhang and Zhening Xing and Yanhong Zeng and Youqing Fang and Kai Chen},
journal= {arXiv preprint arXiv:2312.13964},
year = {2024}
}
备注
Project page: https://pi-animator.github.io/