无训练自适应颜色-风格解耦用于受限文本到图像合成
计算机视觉与模式识别
2024-09-05 v1
摘要
我们考虑如何以解耦的方式独立控制文本到图像扩散模型的输出, Specifically 使用用户提供的参考图像中的颜色和风格属性。我们提出了首个无训练、仅在测试时进行的解耦和条件化文本到图像模型的方法,使其能够从参考图像中分离并利用颜色和风格信息。为实现此目标,我们提出了两个关键创新点。首先,我们提出在推理阶段对潜在代码进行变换,使用特征变换使当前生成的协方差矩阵遵循参考图像的协方差矩阵,从而实现有效的颜色迁移。随后,我们发现颜色与风格在 LAB 图像空间中存在天然的解耦关系,利用此特性对正在生成的图像的自注意力特征图进行变换,使其相对于参考图像(基于其 L 通道计算)的特征图。这些操作完全在测试时进行,且可独立或合并执行。结果形成灵活的方法,允许颜色和风格信息来自同一参考图像或两个不同来源,新生成的内容可在任一情况下无缝融合。
引用
@article{arxiv.2409.02429,
title = {Training-free Color-Style Disentanglement for Constrained Text-to-Image Synthesis},
author = {Aishwarya Agarwal and Srikrishna Karanam and Balaji Vasan Srinivasan},
journal= {arXiv preprint arXiv:2409.02429},
year = {2024}
}
备注
16 pages, 17 figures