ConsiStyle:免训练一致性文本到图像生成中的风格多样性
计算机视觉与模式识别
2026-02-03 v2
摘要
在文本到图像模型中,一致性角色生成是指在遵循不同提示词的同时,保持主体外观不变的任务。然而,由于风格和外观常常纠缠在一起,现有方法难以在遵循不同风格提示词的同时,保持主体特征的一致性。当前用于一致性文本到图像生成的方法通常依赖于在精心挑选的图像集上进行大规模微调或针对每个主体进行优化,这些方法要么无法泛化到不同提示词,要么不能很好地与文本描述对齐。同时,免训练方法通常无法在不同风格下保持主体一致性。在这项工作中,我们首次引入了一种免训练方法,该方法能在不同风格下共同实现风格保持和主体一致性。我们通过操纵注意力矩阵来实现这一点:查询(Queries)和键(Keys)从用于定义主体的锚定图像中获得,而值(Values)则从一个未锚定主体的并行副本中导入。此外,通过扩展键和值矩阵,将跨图像组件添加到自注意力机制中。为了不偏离目标风格,我们对值矩阵的统计量进行了对齐。正如一系列全面的定性和定量实验所证明的,我们的方法有效地将风格与主体外观解耦,并能够忠实地生成在不同风格下具有一致角色的文本对齐图像。
引用
@article{arxiv.2505.20626,
title = {ConsiStyle: Style Diversity in Training-Free Consistent T2I Generation},
author = {Yohai Mazuz and Janna Bruner and Lior Wolf},
journal= {arXiv preprint arXiv:2505.20626},
year = {2026}
}