中文

用密码锁定模型对能力激发进行压力测试

机器学习 2024-05-31 v1 计算与语言

摘要

为了确定大型语言模型(LLM)的安全性,人工智能开发者必须能够评估其危险能力。但简单的提示策略往往无法激发LLM的全部能力。一种更稳健地激发能力的方法是对LLM进行微调以完成任务。在本文中,我们研究了基于微调的能力激发足以激发能力的条件。为此,我们引入了密码锁定模型,即经过微调使其某些能力被故意隐藏的LLM。具体来说,这些LLM被训练成仅当提示中存在密码时才展现这些能力,否则模仿一个弱得多的LLM。密码锁定模型提供了一种评估能力激发方法的新方法,通过测试这些密码锁定的能力是否可以在不使用密码的情况下被激发。我们发现,少量高质量的演示通常足以完全激发密码锁定的能力。更令人惊讶的是,微调可以激发使用相同密码甚至不同密码锁定的其他能力。此外,当只有评估而没有演示时,强化学习等方法仍然通常能够激发能力。总体而言,我们的发现表明,微调是激发当前模型隐藏能力的有效方法,但当高质量演示不可用时(例如,当模型的(隐藏)能力超过人类演示者的能力时),微调可能不可靠。

关键词

引用

@article{arxiv.2405.19550,
  title  = {Stress-Testing Capability Elicitation With Password-Locked Models},
  author = {Ryan Greenblatt and Fabien Roger and Dmitrii Krasheninnikov and David Krueger},
  journal= {arXiv preprint arXiv:2405.19550},
  year   = {2024}
}