中文

仅用少量上下文示例越狱与守护对齐语言模型

机器学习 2024-05-28 v3 人工智能 计算与语言 密码学与安全

摘要

大语言模型(LLMs)在各种任务中展现出显著成功,但其安全性及生成有害内容的风险仍是紧迫问题。在本文中,我们深入探究上下文学习(ICL)调节LLM对齐的潜力。具体而言,我们提出上下文攻击(ICA),利用有害示例颠覆LLM;以及上下文防御(ICD),通过展示拒绝生成有害响应的示例增强模型韧性。我们提供理论洞见以阐明少量上下文示例如何关键影响LLM的安全对齐。通过大量实验,我们证明了ICA和ICD在分别提升和降低越狱提示成功率方面的有效性。我们的发现揭示了ICL对LLM行为的深远影响,为改进LLM安全性开辟了新途径。

关键词

引用

@article{arxiv.2310.06387,
  title  = {Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations},
  author = {Zeming Wei and Yifei Wang and Ang Li and Yichuan Mo and Yisen Wang},
  journal= {arXiv preprint arXiv:2310.06387},
  year   = {2024}
}