中文

文本到图像模型中的危害放大

计算机与社会 2024-08-19 v3 人工智能 机器学习

摘要

文本到图像(T2I)模型已成为生成式AI的重要进展;然而,存在安全隐患:即使用户输入看似安全的提示,模型也可能产生有害的图像输出。这种T2I模型生成输入提示中未明确表达的有害表示的现象,可能比对抗性提示构成更大的风险,使用户无意中暴露于危害之中。本文通过形式化定义这一现象(我们称之为危害放大)来解决该问题。我们进一步贡献了一个量化危害放大的方法论框架,其中考虑用户输入上下文中模型输出的危害。然后,我们实证研究了如何应用这些不同方法来模拟真实世界的部署场景,包括量化危害放大导致的性别间差异性影响。总之,我们的工作旨在为研究人员提供工具,以全面应对T2I系统中的安全挑战,并促进生成式AI模型的负责任部署。

关键词

引用

@article{arxiv.2402.01787,
  title  = {Harm Amplification in Text-to-Image Models},
  author = {Susan Hao and Renee Shelby and Yuchi Liu and Hansa Srinivasan and Mukul Bhutani and Burcu Karagol Ayan and Ryan Poplin and Shivani Poddar and Sarah Laszlo},
  journal= {arXiv preprint arXiv:2402.01787},
  year   = {2024}
}