基于情境语境的人类可解释对抗性提示攻击
计算与语言
2024-07-29 v2
摘要
先前研究在对大语言模型(LLM)进行对抗性攻击测试时,主要关注不毫无意义的提示注入,这些注入在手动或自动审查(例如通过字节熵)时容易被检测。然而,对充满人类可理解性恶意提示并加入对抗性注入的探索仍有限。本研究通过情境驱动的语境重写,将不毫无意义的后缀攻击转换为合理的提示。这使我们能够仅使用LLM执行攻击,而无需任何梯度,从而更好地理解可能的风险范围。我们结合独立的、有意义的对抗性插入和源自电影的情境进行检查,以测试是否可以欺骗LLM。情境从IMDB数据集中提取,提示遵循少量链式思维提示方式。我们的ethods证明,情境驱动的攻击可在开源和专有LLM上成功执行。我们发现,在许多LLM中,仅需1次尝试即可产生攻击,并且这些攻击可在LLM之间传递。
引用
@article{arxiv.2407.14644,
title = {Human-Interpretable Adversarial Prompt Attack on Large Language Models with Situational Context},
author = {Nilanjana Das and Edward Raff and Manas Gaur},
journal= {arXiv preprint arXiv:2407.14644},
year = {2024}
}