面向基础模型的黑盒对抗提示
机器学习
2023-05-30 v2
摘要
提示接口允许用户快速调整视觉与语言中生成模型的输出。然而,提示中的微小改动与设计选择可能导致输出出现显著差异。在本工作中,我们开发了一个用于为非结构化图像与文本生成生成对抗提示的黑盒框架。这些提示可独立使用或前置到良性提示之前,能将特定行为引入生成过程,例如生成特定物体的图像或生成高困惑度文本。
引用
@article{arxiv.2302.04237,
title = {Black Box Adversarial Prompting for Foundation Models},
author = {Natalie Maus and Patrick Chao and Eric Wong and Jacob Gardner},
journal= {arXiv preprint arXiv:2302.04237},
year = {2023}
}