RealCustom:为实时开放域文本到图像定制缩小真实文本词的范围
计算机视觉与模式识别
2024-03-04 v1
摘要
文本到图像定制旨在为给定主体合成文本驱动的图像,最近彻底改变了内容创作。现有工作遵循伪词范式,即将给定主体表示为伪词,然后将其与给定文本组合。然而,伪词与给定文本之间固有的纠缠影响范围导致了双重最优悖论,即给定主体的相似性和给定文本的可控性无法同时达到最优。我们提出了 RealCustom,首次通过精确地将主体影响限制在相关部分,实现了相似性与可控性的解耦。这是通过逐渐将真实文本词从其一般含义缩小到特定主体,并利用其交叉注意力来区分相关性而实现的。具体而言,RealCustom 引入了一种新颖的“训练 - 推理”解耦框架:(1) 在训练期间,RealCustom 通过一种新颖的自适应评分模块学习视觉条件与原始文本条件之间的一般对齐,以自适应地调节影响量;(2) 在推理期间,提出了一种新颖的自适应掩码引导策略,以迭代更新给定主体的影响范围和影响量,从而逐渐缩小真实文本词的生成范围。综合实验表明,RealCustom 在开放域中具有卓越的实时定制能力,首次同时实现了给定主体的前所未有的相似性和给定文本的可控性。项目页面为 https://corleone-huang.github.io/realcustom/。
引用
@article{arxiv.2403.00483,
title = {RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image Customization},
author = {Mengqi Huang and Zhendong Mao and Mingcong Liu and Qian He and Yongdong Zhang},
journal= {arXiv preprint arXiv:2403.00483},
year = {2024}
}
备注
Accepted by CVPR2024