DynaIP:面向可扩展零样本个性化文本到图像生成的动态图像提示适配器
计算机视觉与模式识别
2025-12-11 v1
摘要
个性化文本到图像(PT2I)生成旨在基于参考图像生成定制图像。当前方法关注将图像提示适配器集成以实现无需测试时微调的零样本PT2I。然而,现有方法面临三个根本挑战:1. 在概念保持(CP)与提示遵循(PF)之间寻求平衡的困难,2. 在参考图像中保留细粒度概念细节的困难,3. 对扩展至多主体个性化的可扩展性受限。为解决这些挑战,我们提出了动态图像提示适配器(DynaIP),这是一种新型插件,用于提升细粒度概念忠实度、CP-PF平衡以及SOTA文本到图像多模态扩散变换器(MM-DiT)的主体可扩展性,以实现PT2I生成。我们的关键发现是,MM-DiT在通过交叉注意力将参考图像特征注入其双分支时表现出解耦学习行为。基于此,我们设计了创新的动态解耦策略,以消除推理期间概念无关信息的干扰,显著提升CP-PF平衡并进一步增强多主体组合的可扩展性。此外,我们识别到视觉编码器是影响细粒度CP的关键因素,揭示了常用CLIP的层次特征可捕获不同细节级别的视觉信息。因此,我们引入一种新型的分层专家特征融合模块,充分利用CLIP的层次特征,显著提升细粒度概念忠实度,同时提供视觉细节级别的灵活控制。广泛的在单主体和多主体PT2I任务上的实验表明,我们的DynaIP优于现有方法,为PT2I生成领域带来了显著进展。
引用
@article{arxiv.2512.09814,
title = {DynaIP: Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation},
author = {Zhizhong Wang and Tianyi Chu and Zeyi Huang and Nanyang Wang and Kehan Li},
journal= {arXiv preprint arXiv:2512.09814},
year = {2025}
}