中文

发现用于文本到图像合成的通用语义触发器

密码学与安全 2024-02-14 v1 人工智能

摘要

近年来,文本到图像 (text-to-image) 模型因其可控性和高质量的生成能力而受到社区的广泛关注。然而,此类模型的鲁棒性及其潜在的伦理问题尚未得到充分探索。在本文中,我们引入了通用语义触发器 (Universal Semantic Trigger),这是一种无意义的令牌序列,可添加到输入文本的任何位置,却能诱导生成的图像朝向预设的语义目标。为了深入研究这一现象,我们提出了基于语义梯度的搜索 (Semantic Gradient-based Search, SGS) 框架。SGS 能够基于给定的语义目标自动发现潜在的通用语义触发器。此外,我们设计了评估指标,以全面评估由这些触发器引起的图像语义偏移。我们的实证分析表明,主流开源文本到图像模型易受我们的触发器攻击,这可能构成重大的伦理威胁。我们的工作有助于进一步理解文本到图像合成,并帮助用户在部署前自动审计其模型。

关键词

引用

@article{arxiv.2402.07562,
  title  = {Discovering Universal Semantic Triggers for Text-to-Image Synthesis},
  author = {Shengfang Zhai and Weilong Wang and Jiajun Li and Yinpeng Dong and Hang Su and Qingni Shen},
  journal= {arXiv preprint arXiv:2402.07562},
  year   = {2024}
}

备注

9 pages, 5 figures. Work in progress