CustomContrast:面向主体驱动文本到图像定制的多级对比视角
计算机视觉与模式识别
2025-03-11 v3 多媒体
摘要
主体驱动的文本到图像 (T2I) 定制在学术界和工业界引起了广泛关注。该任务使预训练模型能够基于特定主体生成新图像。现有研究采用自重构视角,专注于捕捉单张图像的所有细节,这会将特定图像的无关属性(如视角、姿态和背景)误认为主体的内在属性。这种误解导致对主体的无关属性和内在属性同时产生过拟合或欠拟合,即这些属性被同时过度表达或表达不足,从而在相似性与可控性之间产生权衡。在本研究中,我们认为理想的主体表示可以通过跨差分视角实现,即通过对比学习将主体内在属性与无关属性解耦,这允许模型通过内部一致性(同一主体的特征在空间上更接近)和外部独特性(不同主体的特征具有显著差异)更关注内在属性。具体而言,我们提出了 CustomContrast,一个新颖的框架,包含多级对比学习 (MCL) 范式和多模态特征注入 (MFI) 编码器。MCL 范式用于通过跨模态语义对比学习和多尺度外观对比学习,从高层语义到低层外观提取主体的内在特征。为了促进对比学习,我们引入了 MFI 编码器以捕捉跨模态表示。大量实验证明了 CustomContrast 在主体相似性和文本可控性方面的有效性。
引用
@article{arxiv.2409.05606,
title = {CustomContrast: A Multilevel Contrastive Perspective For Subject-Driven Text-to-Image Customization},
author = {Nan Chen and Mengqi Huang and Zhuowei Chen and Yang Zheng and Lei Zhang and Zhendong Mao},
journal= {arXiv preprint arXiv:2409.05606},
year = {2025}
}