基于单轮递增攻击(STCA)的文本到图像护栏有效性指示器
密码学与安全
2024-12-02 v1 计算与语言
摘要
单轮递增攻击(STCA)首次由 Aqrawi 和 Abbasi [2024] 提出,是一种旨在绕过文本到文本 AI 模型伦理护栏,以使其生成有害内容的创新方法。该技术利用单提示内上下文的战略递增,结合信任建立机制,以微妙方式欺骗模型以产生意外输出。将 STCA 扩展至文本到图像模型,我们通过破坏广受欢迎的模型 DALL-E 3 的护栏,实现其输出可与来自未受抑制模型 Flux Schnell(作为基线对照)的输出相当。本研究为研究人员提供了框架,以严格评估文本到图像模型护栏的鲁棒性,并对抗性攻击的韧性进行基准测试。
引用
@article{arxiv.2411.18699,
title = {An indicator for effectiveness of text-to-image guardrails utilizing the Single-Turn Crescendo Attack (STCA)},
author = {Ted Kwartler and Nataliia Bagan and Ivan Banny and Alan Aqrawi and Arian Abbasi},
journal= {arXiv preprint arXiv:2411.18699},
year = {2024}
}