寻找披着羊皮的狼:利用文本摘要对抗恶意文本生成图像提示
密码学与安全
2024-12-18 v1 人工智能
计算与语言
摘要
文本生成图像模型容易受到逐步式的“分而治之攻击”,该攻击利用大语言模型通过将敏感文本包裹在良性叙事中来混淆提示中的不当内容。为了缓解逐步式 DACA 攻击,我们提出了一种双层方法,包括文本摘要和随后的二元分类。我们构建了对抗性文本生成图像提示(ATTIP)数据集(),其中包含 DACA 混淆和非混淆的提示。从 ATTIP 数据集中,我们创建了两个摘要版本:一个由小型编码器模型生成,另一个由大语言模型生成。然后,我们使用编码器分类器和 GPT-4o 分类器对摘要和未摘要的提示进行内容审核。与在未摘要数据上运行的分类器相比,我们的方法将 F1 分数性能提高了 31%。此外,记录到的最高 F1 分数(98%)是由编码器分类器在摘要的 ATTIP 变体上取得的。本研究表明,分类前的文本摘要可以使内容检测模型对逐步式 DACA 混淆产生免疫。
引用
@article{arxiv.2412.12212,
title = {Finding a Wolf in Sheep's Clothing: Combating Adversarial Text-To-Image Prompts with Text Summarization},
author = {Portia Cooper and Harshita Narnoli and Mihai Surdeanu},
journal= {arXiv preprint arXiv:2412.12212},
year = {2024}
}