中文

PIA:基于文本到图像模型中即插即用模块的个性化图像动画器

统计力学 2026-01-08 v2 软凝聚态物质

摘要

个性化文本到图像(T2I)模型的最新进展彻底改变了内容创作,使非专业人士能够生成具有独特风格的惊艳图像。尽管前景广阔,但通过文本为这些个性化图像添加逼真运动在保持独特风格、高保真细节以及通过文本实现运动可控性方面提出了重大挑战。在本文中,我们提出了 PIA,一种个性化图像动画器,它擅长与条件图像对齐,通过文本实现运动可控性,并且无需特定调优即可与各种个性化 T2I 模型兼容。为了实现这些目标,PIA 构建于具有训练良好的时间对齐层的基础 T2I 模型之上,允许将任何个性化 T2I 模型无缝转换为图像动画模型。PIA 的一个关键组件是条件模块的引入,该模块利用条件帧和帧间亲和力作为输入,在亲和力提示的引导下为潜在空间中的单帧合成传递外观信息。这种设计缓解了内部与外观相关的图像对齐挑战,并允许更专注于与运动相关的指导对齐。

关键词

引用

@article{arxiv.2312.13963,
  title  = {Biased motility-induced phase separation: from chemotaxis to traffic jams},
  author = {Eric Bertin and Alexandre Solon},
  journal= {arXiv preprint arXiv:2312.13963},
  year   = {2026}
}

备注

19 pages, 6 figures, 1 movie