词性攻击:文本到图像生成中的实证研究
计算与语言
2024-09-25 v1 人工智能
密码学与安全
机器学习
摘要
近期研究表明,文本到图像 (T2I) 模型对名词 perturbation 的对抗攻击尤为脆弱。本研究探讨了对 T2I 模型不同词性标签 within text prompts 所施加的对抗攻击影响。我们构建了一个高质量的数据集,用于实现真实可行的词性标签 token 置换,并进行梯度攻击以寻找误导 T2I 模型生成图像的对抗后缀。我们的实证结果表明,攻击成功率 (ASR) 在不同词性类别间存在显著差异,其中名词、专有名词和形容词最易受到攻击。我们探讨了对抗后缀驾驶效应的机制,发现不同词性类别中关键 token 数量和内容融合程度各异,而后缀可迁移性等特征在各类别中保持一致。我们已将实现代码公开于 - https://github.com/shahariar-shibli/Adversarial-Attack-on-POS-Tags。
引用
@article{arxiv.2409.15381,
title = {Adversarial Attacks on Parts of Speech: An Empirical Study in Text-to-Image Generation},
author = {G M Shahariar and Jia Chen and Jiachen Li and Yue Dong},
journal= {arXiv preprint arXiv:2409.15381},
year = {2024}
}
备注
Findings of the EMNLP 2024