LLM 安全性是否应超越拒绝有害指令?
计算与语言
2025-06-05 v2
摘要
本文对大型语言模型(LLM)在长尾分布(加密)文本上的行为及其安全影响进行了系统性评估。我们引入了一个二维框架来评估 LLM 安全性:(1)指令拒绝——拒绝有害混淆指令的能力,以及(2)生成安全性——抑制生成有害响应。通过综合实验,我们证明具备解密密码能力的模型可能容易受到不匹配泛化攻击:其安全机制在至少一个安全维度上失效,导致不安全响应或过度拒绝。基于这些发现,我们评估了多种 LLM 前和 LLM 后安全防护措施,并讨论了它们的优势与局限性。这项工作有助于理解 LLM 在长尾文本场景中的安全性,并为开发稳健的安全机制提供了方向。
引用
@article{arxiv.2506.02442,
title = {Should LLM Safety Be More Than Refusing Harmful Instructions?},
author = {Utsav Maskey and Mark Dras and Usman Naseem},
journal= {arXiv preprint arXiv:2506.02442},
year = {2025}
}
备注
Preprint