文本到图像生成中的对抗攻击不对称偏差
机器学习
2024-07-18 v3 密码学与安全
摘要
文本到图像模型在内容生成中的广泛使用要求仔细检查其安全性,包括对对抗攻击的鲁棒性。尽管对抗攻击研究广泛,但其有效性的原因仍未充分探索。本文对文本到图像模型的对抗攻击进行了实证研究,重点分析了与攻击成功率相关的因素。我们引入了一个新的攻击目标——使用对抗后缀的实体替换,以及两种基于梯度的攻击算法。人工和自动评估揭示了实体替换攻击成功率的不对称性:例如,在提示“a human dancing in the rain.”中添加对抗后缀更容易将“human”替换为“robot”,但反向替换则困难得多。我们进一步提出了探测指标,以从模型的信念中建立对抗攻击成功率的指示性信号。我们识别出导致对抗攻击成功概率为60%的条件,以及该概率降至5%以下的条件。
引用
@article{arxiv.2312.14440,
title = {Asymmetric Bias in Text-to-Image Generation with Adversarial Attacks},
author = {Haz Sameen Shahgir and Xianghao Kong and Greg Ver Steeg and Yue Dong},
journal= {arXiv preprint arXiv:2312.14440},
year = {2024}
}
备注
camera-ready version