中文

揭开画布:面向图像生成越狱与大语言模型内容安全的动态基准

计算与语言 2025-05-08 v1 人工智能 计算机与社会

摘要

现有大语言模型(LLMs)发展迅速,在图像生成任务中取得了卓越成果,但其内容安全检查仍易受基于提示的越狱攻击。通过在 ChatGPT、MetaAI 和 Grok 等平台上的初步测试,我们观察到,即使是简短、自然的提示也可能导致生成具有危害性的图像,从伪造文件的逼真描绘到公众人物的篡改图像。我们引入了揭开画布(UTC 基准;UTCB),这是一个动态且可扩展的基准数据集,用于评估大语言模型在图像生成中的脆弱性。我们的方法结合了结构化提示工程、多语言混淆(例如祖鲁语、盖尔语、Base64)以及使用 Groq 托管的 LLaMA-3 进行评估。该流程支持零样本和回退提示策略、风险评分及自动标记。所有生成内容均存储有丰富的元数据,并分为青铜(未验证)、白银(LLM 辅助验证)和黄金(人工验证)三个层级。UTCB 旨在随着新数据源、提示模板和模型行为的出现而不断演进。警告:本文包含旨在测试模型安全性的对抗性输入的可视化示例。所有输出均已进行编辑以确保负责任地披露。

关键词

引用

@article{arxiv.2505.04146,
  title  = {Unmasking the Canvas: A Dynamic Benchmark for Image Generation Jailbreaking and LLM Content Safety},
  author = {Variath Madhupal Gautham Nair and Vishal Varma Dantuluri},
  journal= {arXiv preprint arXiv:2505.04146},
  year   = {2025}
}