中文

面向精确控制 LLM 输出的通用且与上下文无关的触发器

计算与语言 2024-11-25 v1 人工智能 密码学与安全

摘要

大语言模型 (LLM) 已在自动内容生成等应用中广泛采用,甚至被用于关键决策系统。然而,提示注入风险允许对 LLM 输出进行潜在操控。尽管已记录了诸多攻击方法,但要实现对这些输出的完全控制仍具有挑战,往往需要经验丰富的攻击者进行多次尝试,且高度依赖提示上下文。近期基于梯度的白盒攻击技术在越狱和系统提示泄露等任务中显示出前景。我们的研究将基于梯度的攻击推广到寻找一种触发器,使其 (1) 通用:有效地无论针对目标输出; (2) 与上下文无关:在 diverse prompt contexts 中稳健;以及 (3) 精确输出:能够以高准确率操控 LLM 输入以产生指定的任何输出。我们提出了一种高效发现此类触发器的方法并评估其有效性。此外,我们讨论了此类攻击对 LLM 应用的重大威胁,凸显了对 AI 代理所做决定和行动的潜在颠覆风险。

关键词

引用

@article{arxiv.2411.14738,
  title  = {Universal and Context-Independent Triggers for Precise Control of LLM Outputs},
  author = {Jiashuo Liang and Guancheng Li and Yang Yu},
  journal= {arXiv preprint arXiv:2411.14738},
  year   = {2024}
}