中文

大语言模型对齐的根本局限

计算与语言 2024-06-04 v6 人工智能

摘要

在开发与人类交互的语言模型时,一个重要方面是将其行为对齐,使其对人类用户有用且无害。这通常通过以强化期望行为并抑制不期望行为的方式调优模型来实现,该过程被称为对齐。在本文中,我们提出一种称为行为期望界(BEB)的理论方法,使我们能够形式化研究大语言模型对齐的若干固有特征与局限。重要的是,我们证明在该框架限度内,对于任何模型以有限概率表现出的行为,都存在可触发模型输出该行为的提示,且概率随提示长度增加而升高。这意味着任何弱化但未彻底消除不期望行为的对齐过程,都无法抵御对抗性提示攻击。此外,我们的框架暗示了诸如基于人类反馈的强化学习等主流对齐方法使 LLM 易被提示触发不期望行为的机制。这一理论结果正由所谓的当代“chatGPT jailbreaks”大规模实验性展示:对抗性用户通过触发模型扮演恶意角色,诱使其突破对齐护栏。我们的结果揭示了 LLM 对齐中的根本局限,并凸显出设计可靠机制以确保 AI 安全的必要性。

关键词

引用

@article{arxiv.2304.11082,
  title  = {Fundamental Limitations of Alignment in Large Language Models},
  author = {Yotam Wolf and Noam Wies and Oshri Avnery and Yoav Levine and Amnon Shashua},
  journal= {arXiv preprint arXiv:2304.11082},
  year   = {2024}
}