ExtremeAIGC:评估大多模态模型对AI生成极端内容脆弱性的基准测试
密码学与安全
2025-03-14 v1 计算与语言
摘要
大多模态模型(LMMs)日益受到AI生成极端内容的威胁,包括逼真的图像和文本,这些内容可被用于绕过安全机制并生成有害输出。然而,现有用于评估LMM鲁棒性的数据集对极端内容的探索有限,往往缺乏AI生成的图像、多样化的图像生成模型以及对历史事件的全面覆盖,这阻碍了对模型脆弱性的完整评估。为填补这一空白,本文引入了ExtremeAIGC,一个旨在评估LMM对极端内容脆弱性的基准数据集和评估框架。ExtremeAIGC通过利用最先进的图像生成技术精心策划多样化的文本和图像示例,模拟真实世界事件和恶意使用场景。本研究揭示了LMM中令人担忧的弱点,表明即使是最先进的安全措施也无法阻止极端材料的生成。本文系统地量化了各种攻击策略的成功率,暴露了当前防御中的关键缺口,并强调了需要更稳健的缓解策略。
引用
@article{arxiv.2503.09964,
title = {ExtremeAIGC: Benchmarking LMM Vulnerability to AI-Generated Extremist Content},
author = {Bhavik Chandna and Mariam Aboujenane and Usman Naseem},
journal= {arXiv preprint arXiv:2503.09964},
year = {2025}
}
备注
Preprint