无训练版文本到图像模型的版本化
计算机视觉与模式识别
2024-05-28 v1 机器学习
摘要
灵感来自软件行业为满足特定用户群体或用例需求而提供不同版本/编辑的做法,我们提出一种新任务,即无训练版版本化(training-free editioning),用于文本到图像模型。具体而言,我们旨在无需重新训练即可创建基准文本到图像模型的变体,使其能够满足不同用户群体的需求或提供不同的功能。为实现这一目标,我们提出,给定文本到图像模型的不同版本可形式化为其文本编码器(如 CLIP)中的概念子空间。在此概念子空间中,所有点都满足特定用户需求(例如生成猫在草地/地面/掉落树叶上方的图像)。技术上,我们应用主成分分析(PCA)从代表性文本嵌入中获取对应特定用户需求或要求的概念子空间。将给定提示的文本嵌入投影到这些低维子空间后,即可实现无需重新训练的高效模型版本化。直观而言,我们提出的版本化范式使服务提供商能够将基准模型定制为其“猫版”(或其他版本),无论用户提示为何(例如狗、人等),都限制图像生成为猫。这是一种为文本到图像生成器引入新维度的做法,涵盖面向产品差异化、目标功能和定价策略的广泛应用,为文本到图像生成器的商业模式开辟了新路径。大量实验结果表明,我们的方法有效且具有潜力,可在各种领域和应用中实现广泛的定制化文本到图像模型版本。
引用
@article{arxiv.2405.17069,
title = {Training-free Editioning of Text-to-Image Models},
author = {Jinqi Wang and Yunfei Fu and Zhangcan Ding and Bailin Deng and Yu-Kun Lai and Yipeng Qin},
journal= {arXiv preprint arXiv:2405.17069},
year = {2024}
}