AnyStory:面向统一单主体与多主体个性化的文本到图像生成
计算机视觉与模式识别
2025-05-02 v2
摘要
最近的大规模生成模型展示了惊人的文本到图像生成能力。然而,针对特定主体生成高保真度的个性化图像仍面临挑战,尤其是在涉及多个主体的情况下。本文提出了 AnyStory,一种用于主体个性化生成的统一方法。AnyStory 不仅实现了单主体的高保真度个性化,还实现了多主体的个性化,且不牺牲主体保真度。具体而言,AnyStory 以“编码-路由”方式来建模主体个性化问题。在编码步骤中,AnyStory 利用通用且强大的图像编码器,即 ReferenceNet,联合 CLIP 视觉编码器,实现对主体特征的高保真编码。在路由步骤中,AnyStory 利用解耦的实例感知主体路由器准确感知和预测相应主体在潜在空间中的潜在位置,并引导主体条件的注入。详细的实验结果表明,我们的方法在保持主体细节、对齐文本描述以及实现多主体个性化方面表现优异。项目页面位于 https://aigcdesigngroup.github.io/AnyStory/。
引用
@article{arxiv.2501.09503,
title = {AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation},
author = {Junjie He and Yuxiang Tuo and Binghui Chen and Chongyang Zhong and Yifeng Geng and Liefeng Bo},
journal= {arXiv preprint arXiv:2501.09503},
year = {2025}
}
备注
Tech report; Project page: https://aigcdesigngroup.github.io/AnyStory/