RealCustom++:以真实文本词表示图像实现实时定制
计算机视觉与模式识别
2025-10-28 v3
摘要
给定一段文本和一张特定主体的图像,文本到图像定制旨在生成与文本和主体外观均对齐的新图像。现有工作遵循伪词范式,将主体表示为一个不存在的伪词,并与其他文本结合来生成图像。然而,伪词因其不同的学习目标产生语义冲突,并与其它文本产生重叠影响范围的纠缠,导致主体相似性和文本可控性无法同时最优的双重最优悖论。为解决此问题,我们提出 RealCustom++,一种新颖的真词范式,以无冲突的真实词表示主体,首先生成连贯的引导图像和对应的主体掩码,从而解耦文本和主体的影响范围以实现同时优化。具体而言,RealCustom++ 引入了一种训练推理解耦框架:(1) 训练阶段,学习视觉条件与文本中所有真实词之间的一般对齐关系;(2) 推理阶段,采用双分支架构,其中引导分支产生主体引导掩码,生成分支利用该掩码仅在主体相关区域内对特定真实词进行定制。与此前仅在可控性或相似性上表现优异的方法不同,RealCustom++ 在两者上均取得更优性能,在可控性上提升 7.48%,在相似性上提升 3.04%,在生成质量上提升 76.43%。对于多主体定制,RealCustom++ 进一步在可控性上提升 4.6%,在多主体相似性上提升 6.34%。我们的工作已应用于字节跳动的 JiMeng,代码已发布于 https://github.com/bytedance/RealCustom。
引用
@article{arxiv.2408.09744,
title = {RealCustom++: Representing Images as Real Textual Word for Real-Time Customization},
author = {Zhendong Mao and Mengqi Huang and Fei Ding and Mingcong Liu and Qian He and Yongdong Zhang},
journal= {arXiv preprint arXiv:2408.09744},
year = {2025}
}
备注
18 pages