迭代引导多模态大语言模型重现自然图像与AI生成图像
密码学与安全
2024-04-23 v1 计算与语言
计算机视觉与模式识别
摘要
随着数字图像领域的快速演变,图像库和AI生成图像市场已成为视觉媒体的核心。传统的库存图像如今与以DALL-E 3和Midjourney等高级API驱动的创新平台并存,这些平台交易AI生成视觉的提示词。本文研究了利用具备增强视觉理解能力的多模态模型来模仿这些平台输出的可能性,提出了一种原创攻击策略。我们的方法利用微调的CLIP模型、多标签分类器和GPT-4V的描述性能力,创建能够生成类似市场上可用图像和来自高级库存图像提供商的图像的提示词,费用显著低于市场价格。就本策略而言,我们旨在在数字图像领域凸显一种新的经济和安全考虑。我们的发现通过自动化指标和人类评估支持,表明可为数十分之一的当前市场价格(每图像0.27)生成相当的视觉内容,凸显了在日益融合AI的环境中关于数字媒体完整性的意识和战略讨论的必要性。我们的工作还通过组装约1900万条由流行Midjourney平台生成的提示词-图像对数据集,为该领域做出了贡献,该数据集计划公开发布。
引用
@article{arxiv.2404.13784,
title = {Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images},
author = {Ali Naseh and Katherine Thai and Mohit Iyyer and Amir Houmansadr},
journal= {arXiv preprint arXiv:2404.13784},
year = {2024}
}