中文

文本到图像生成中的对抗攻击不对称偏差

机器学习 2024-07-18 v3 密码学与安全

摘要

文本到图像模型在内容生成中的广泛使用要求仔细检查其安全性,包括对对抗攻击的鲁棒性。尽管对抗攻击研究广泛,但其有效性的原因仍未充分探索。本文对文本到图像模型的对抗攻击进行了实证研究,重点分析了与攻击成功率相关的因素。我们引入了一个新的攻击目标——使用对抗后缀的实体替换,以及两种基于梯度的攻击算法。人工和自动评估揭示了实体替换攻击成功率的不对称性:例如,在提示“a human dancing in the rain.”中添加对抗后缀更容易将“human”替换为“robot”,但反向替换则困难得多。我们进一步提出了探测指标,以从模型的信念中建立对抗攻击成功率的指示性信号。我们识别出导致对抗攻击成功概率为60%的条件,以及该概率降至5%以下的条件。

关键词

引用

@article{arxiv.2312.14440,
  title  = {Asymmetric Bias in Text-to-Image Generation with Adversarial Attacks},
  author = {Haz Sameen Shahgir and Xianghao Kong and Greg Ver Steeg and Yue Dong},
  journal= {arXiv preprint arXiv:2312.14440},
  year   = {2024}
}

备注

camera-ready version