中文

"不匹配"并不等同于"恶意": 对大型语言模型越狱幻觉的谨慎处理

计算与语言 2025-02-04 v2

摘要

"越狱"是大型语言模型(LLM)的一个重大安全问题,当恶意提示导致 LLM 生成有害输出时,涉及 LLM 可靠性和安全性的问题。因此,对越狱的有效评估对于开发缓解策略至关重要。然而,我们的研究揭示了当前评估所识别的许多越狱实际上可能是幻觉——即误认为是真实安全违规的错误输出。这一发现表明,一些被视为漏洞的现象可能并不代表实际威胁,表明需要更精确的红队基准测试。为此,我们提出了针对幻觉和越狱评估的 B\textbf{B}enchmark for reliAB\textbf{AB}ilitY\textbf{Y} and jailB\textbf{B}reak haL\textbf{L}lU\textbf{U}cination E\textbf{E}valuation(BabyBLUE)。BabyBLUE 引入了各种评估者,以增强现有越狱基准测试,确保输出是有用且恶意的指令。此外,BabyBLUE 提供了一个新数据集,用于增强现有的红队基准测试,特别针对越狱中的幻觉问题,旨在评估被越狱的 LLM 输出对人类社会可能造成的真实危害。

关键词

引用

@article{arxiv.2406.11668,
  title  = {"Not Aligned" is Not "Malicious": Being Careful about Hallucinations of Large Language Models' Jailbreak},
  author = {Lingrui Mei and Shenghua Liu and Yiwei Wang and Baolong Bi and Jiayi Mao and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2406.11668},
  year   = {2025}
}

备注

COLING 2025