Toffee: 面向主体驱动文本到图像生成的高效百万级数据集构建
计算机视觉与模式识别
2024-08-09 v2
摘要
在主体驱动的文本到图像生成中,最近的工作通过在包含大量图像对的合成数据集上训练模型取得了优越的性能。在这些数据集上训练后,生成模型可以以零样本方式从任意测试图像中为特定主体生成与文本对齐的图像。它们甚至优于需要在测试图像上进行额外微调的方法。然而,创建此类数据集的成本对于大多数研究人员来说是难以承受的。为了生成单个训练对,当前方法在主体图像上微调预训练的文本到图像模型以捕获细粒度细节,然后使用微调后的模型基于创意文本提示为同一主体创建图像。因此,构建包含数百万个主体的大规模数据集可能需要数十万 GPU 小时。为了解决这个问题,我们提出了 Toffee,一种用于构建主体驱动编辑和生成数据集的高效方法。具体来说,我们的数据集构建不需要任何主体级别的微调。在预训练两个生成模型后,我们能够生成无限数量的高质量样本。我们构建了第一个用于主体驱动图像编辑和生成的大规模数据集,其中包含 500 万个图像对、文本提示和掩码。我们的数据集是之前最大数据集的 5 倍,但我们的成本却低了数万 GPU 小时。为了测试所提出的数据集,我们还提出了一个能够同时进行主体驱动图像编辑和生成的模型。通过简单地在我们的数据集上训练该模型,它获得了有竞争力的结果,说明了所提出的数据集构建框架的有效性。
引用
@article{arxiv.2406.09305,
title = {Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation},
author = {Yufan Zhou and Ruiyi Zhang and Kaizhi Zheng and Nanxuan Zhao and Jiuxiang Gu and Zichao Wang and Xin Eric Wang and Tong Sun},
journal= {arXiv preprint arXiv:2406.09305},
year = {2024}
}