中文

逼他们招供!从(生产环境)大语言模型中强制提取知识

密码学与安全 2023-12-11 v1 机器学习

摘要

大语言模型(LLMs)现已广泛应用于各种场景,使其伦理标准与人类价值观对齐至关重要。然而,最近的越狱方法表明,这种对齐可以通过精心构造的提示被破坏。在我们的研究中,我们揭示了对LLM对齐的一种新威胁:当恶意行为者能够访问模型的输出logits时——这是开源LLM和许多商业LLM API(例如某些GPT模型)中的常见特性。该方法不依赖于构造特定提示,而是利用这样一个事实:即使LLM拒绝了有毒请求,有害响应往往仍深藏在输出logits中。通过在自回归生成过程中的少数关键输出位置强制选择排名较低的输出token,我们可以迫使模型揭示这些隐藏的响应。我们将此过程称为模型审讯。这种方法不同于越狱方法且效果更优,有效性达到92%(越狱方法为62%),且速度快10到20倍。通过我们的方法发现的有害内容更相关、更完整、更清晰。此外,它可以补充越狱策略,结合使用可进一步提升攻击性能。我们的发现表明,审讯甚至可以从专门为编码任务设计的模型中提取有毒知识。

关键词

引用

@article{arxiv.2312.04782,
  title  = {Make Them Spill the Beans! Coercive Knowledge Extraction from (Production) LLMs},
  author = {Zhuo Zhang and Guangyu Shen and Guanhong Tao and Siyuan Cheng and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2312.04782},
  year   = {2023}
}