Adversarial Nibbler:一个以数据为中心、改善文本到图像模型安全性的挑战赛
机器学习
2023-05-25 v1 人工智能
密码学与安全
计算机视觉与模式识别
摘要
近年来的生成式 AI 革命由算力与数据量的扩张所推动,二者共同实现了强大文本到图像(T2I)模型的大规模预训练。随着生成逼真且创意内容的能力增强,诸如 DALL-E、MidJourney、Imagen 或 Stable Diffusion 等 T2I 模型正触达愈发广泛的受众。从未经筛选的互联网抓取数据集预训练继承的任何不安全行为,因此有可能造成大范围危害,例如通过生成的暴力、色情或含有偏见与贬损刻板印象的图像。尽管存在此种危害风险,我们仍缺乏系统且结构化的评估数据集来审视模型行为,尤其是绕过现有安全过滤器的对抗攻击。安全评估中的典型瓶颈在于评估集难以广泛覆盖不同类型的高难度样本,即识别“未知的未知”或长尾问题。为满足该需求,我们引入 Adversarial Nibbler 挑战赛。该挑战赛旨在众包多样化的失效模式,并奖励成功发现当前最先进 T2I 模型安全漏洞的参与者。最终,我们旨在提升对这些问题的认知,并协助开发者改进未来生成式 AI 模型的安全性与可靠性。Adversarial Nibbler 是一个以数据为中心的挑战赛,属于 DataPerf 挑战赛系列,由 Kaggle 和 MLCommons 组织并支持。
引用
@article{arxiv.2305.14384,
title = {Adversarial Nibbler: A Data-Centric Challenge for Improving the Safety of Text-to-Image Models},
author = {Alicia Parrish and Hannah Rose Kirk and Jessica Quaye and Charvi Rastogi and Max Bartolo and Oana Inel and Juan Ciro and Rafael Mosquera and Addison Howard and Will Cukierski and D. Sculley and Vijay Janapa Reddi and Lora Aroyo},
journal= {arXiv preprint arXiv:2305.14384},
year = {2023}
}