通过情境经验回放和语义保持提示重写进行文本到图像模型的红队测试
机器学习
2026-05-13 v3 计算与语言
密码学与安全
计算机视觉与模式识别
摘要
了解文本到图像(T2I)模型在有害内容生成方面的能力对于安全性和合规性至关重要。然而,人工红队测试成本高昂且不一致,推动了需要模拟真实滥用尝试的自动化工具。现有方法要么需要白盒访问,要么无法在不同防御措施之间普遍化,要么产生难以解释的对抗标记,而在保持原始有害意图的同时生成流畅提示仍未得到充分探索,尽管这在实际应用中具有重要意义。我们提出了ICER框架,通过两个组件来解决这一问题:一个基于大语言模型的重写器,生成流畅、自然语言的对抗提示;以及情境经验回放,该机制将成功的越狱模式积累为可重用的先验。通过赝博优化将这些组件集成,使ICER能够有效地平衡利用已证明的攻击策略与探索新策略。实验覆盖六种安全机制,ICER在标准和语义保持评估下均优于七个基线方法,超过30%的生成提示可 transfer 到 DALL-E 3 和 Midjourney 等商业系统。
引用
@article{arxiv.2411.16769,
title = {Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting},
author = {Zhi-Yi Chin and Pin-Yu Chen and Wei-Chen Chiu and Mario Fritz},
journal= {arXiv preprint arXiv:2411.16769},
year = {2026}
}
备注
The source code is available at https://github.com/zhiyichin/ICER