中文

LLM 安全性是否应超越拒绝有害指令?

计算与语言 2025-06-05 v2

摘要

本文对大型语言模型(LLM)在长尾分布(加密)文本上的行为及其安全影响进行了系统性评估。我们引入了一个二维框架来评估 LLM 安全性:(1)指令拒绝——拒绝有害混淆指令的能力,以及(2)生成安全性——抑制生成有害响应。通过综合实验,我们证明具备解密密码能力的模型可能容易受到不匹配泛化攻击:其安全机制在至少一个安全维度上失效,导致不安全响应或过度拒绝。基于这些发现,我们评估了多种 LLM 前和 LLM 后安全防护措施,并讨论了它们的优势与局限性。这项工作有助于理解 LLM 在长尾文本场景中的安全性,并为开发稳健的安全机制提供了方向。

关键词

引用

@article{arxiv.2506.02442,
  title  = {Should LLM Safety Be More Than Refusing Harmful Instructions?},
  author = {Utsav Maskey and Mark Dras and Usman Naseem},
  journal= {arXiv preprint arXiv:2506.02442},
  year   = {2025}
}

备注

Preprint