Cones 2:多主体可定制图像合成
计算机视觉与模式识别
2023-06-01 v1
摘要
由于其实用应用,合成用户指定主体的图像受到越来越多的关注。尽管近期在单主体定制方面取得成功,现有算法在训练成本高且成功率低的问题随主体数量增加而加剧。为实现以多个主体为约束的可控图像合成,本工作研究如何高效表示特定主体以及如何恰当组合不同主体。我们发现,关于主体 token 的文本嵌入已作为一种简单而有效的表示,支持任意组合且无需任何模型调优。通过学习基础嵌入之上的残差,我们能够在各种文本条件下鲁棒地将原始主体偏移至定制主体。我们随后提出采用布局——一种非常抽象且易获取的先验——作为主体排列的空间引导。通过修正交叉注意力图中的激活,布局指定并分离图像中不同主体的位置,显著缓解它们之间的相互干扰。定性与定量实验结果均表明,在多主体定制的多种设置下,我们相对于最先进替代方法具有优越性。
引用
@article{arxiv.2305.19327,
title = {Cones 2: Customizable Image Synthesis with Multiple Subjects},
author = {Zhiheng Liu and Yifei Zhang and Yujun Shen and Kecheng Zheng and Kai Zhu and Ruili Feng and Yu Liu and Deli Zhao and Jingren Zhou and Yang Cao},
journal= {arXiv preprint arXiv:2305.19327},
year = {2023}
}