中文

利用幻觉绕过 GPT4 的过滤器

密码学与安全 2024-03-12 v2 人工智能 计算与语言 机器学习

摘要

大语言模型(LLMs)首先在大量数据上进行训练,然后通过人类反馈强化学习(RLHF)进行微调;这也用于教导 LLM 提供恰当且安全的回复。在本文中,我们提出了一种新方法,操纵微调后的版本使其恢复到 RLHF 之前的行为,从而有效擦除模型的过滤器;该漏洞利用目前适用于 GPT4、Claude Sonnet,并在某种程度上适用于 Inflection-2.5。与其他越狱方法(例如流行的“Do Anything Now”(DAN))不同,我们的方法不依赖于指示 LLM 覆盖其 RLHF 策略;因此,仅仅修改 RLHF 过程不太可能解决该问题。相反,我们诱导涉及反向文本的幻觉,在此期间模型退化为词桶,有效地暂停了模型的过滤器。我们认为,我们的漏洞利用揭示了 LLM 中一个目前尚未解决的根本性漏洞,同时也提供了一个更好地理解 LLM 在幻觉期间内部工作机制的机会。

关键词

引用

@article{arxiv.2403.04769,
  title  = {Using Hallucinations to Bypass GPT4's Filter},
  author = {Benjamin Lemkin},
  journal= {arXiv preprint arXiv:2403.04769},
  year   = {2024}
}