需要多少张图像?估计文本到图像模型中的模仿阈值
计算机视觉与模式识别
2026-01-07 v2
摘要
文本到图像模型使用从互联网收集的大规模图像-文本对数据集进行训练。这些数据集通常包含受版权保护和私密的图像。在此类数据集上训练模型使其能够生成可能侵犯版权法和个人隐私的图像。这种现象被称为模仿——生成内容与其训练图像具有可识别相似性的图像。在这项工作中,我们估计了模型在某个概念上训练了足够多的实例以能够模仿它的临界点——模仿阈值。我们将此问题作为一个新问题提出,并提出了一种高效的方法,无需承担从头训练这些模型的巨大成本即可估计模仿阈值。我们在两个领域——人脸和艺术风格——进行了实验,并评估了在三个预训练数据集上训练的四个文本到图像模型。我们估计这些模型的模仿阈值在200-700张图像范围内,具体取决于领域和模型。模仿阈值为版权侵权主张提供了经验基础,并作为旨在遵守版权和隐私法的文本到图像模型开发者的指导原则。网站:https://how-many-van-goghs-does-it-take.github.io/。代码:https://github.com/vsahil/MIMETIC-2。
引用
@article{arxiv.2410.15002,
title = {How Many Images Does It Take? Estimating Imitation Thresholds in Text-to-Image Models},
author = {Sahil Verma and Royi Rassin and Arnav Das and Gantavya Bhatt and Preethi Seshadri and Chirag Shah and Jeff Bilmes and Hannaneh Hajishirzi and Yanai Elazar},
journal= {arXiv preprint arXiv:2410.15002},
year = {2026}
}
备注
Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs