从生成图像中识别提示的艺术家姓名
计算机视觉与模式识别
2025-07-25 v1
摘要
文本到图像模型的一个常见且有争议的用途是通过明确命名艺术家来生成图片,例如“以Greg Rutkowski的风格”。我们引入了一个用于提示艺术家识别的基准:仅从图像预测提示中调用了哪些艺术家姓名。该数据集包含195万张图像,涵盖110位艺术家,并跨越四种泛化设置:未见过的艺术家、增加提示复杂度、多艺术家提示以及不同的文本到图像模型。我们评估了特征相似性基线、对比风格描述符、数据归因方法、监督分类器和少样本原型网络。泛化模式各不相同:监督和少样本模型在见过的艺术家和复杂提示上表现出色,而风格描述符在艺术家风格突出时迁移效果更好;多艺术家提示仍然是最具挑战性的。我们的基准揭示了巨大的提升空间,并提供了一个公共测试平台,以促进文本到图像模型的负责任监管。我们发布数据集和基准以促进进一步研究:https://graceduansu.github.io/IdentifyingPromptedArtists/。
引用
@article{arxiv.2507.18633,
title = {Identifying Prompted Artist Names from Generated Images},
author = {Grace Su and Sheng-Yu Wang and Aaron Hertzmann and Eli Shechtman and Jun-Yan Zhu and Richard Zhang},
journal= {arXiv preprint arXiv:2507.18633},
year = {2025}
}
备注
Project page: https://graceduansu.github.io/IdentifyingPromptedArtists