"不匹配"并不等同于"恶意": 对大型语言模型越狱幻觉的谨慎处理
计算与语言
2025-02-04 v2
摘要
"越狱"是大型语言模型(LLM)的一个重大安全问题,当恶意提示导致 LLM 生成有害输出时,涉及 LLM 可靠性和安全性的问题。因此,对越狱的有效评估对于开发缓解策略至关重要。然而,我们的研究揭示了当前评估所识别的许多越狱实际上可能是幻觉——即误认为是真实安全违规的错误输出。这一发现表明,一些被视为漏洞的现象可能并不代表实际威胁,表明需要更精确的红队基准测试。为此,我们提出了针对幻觉和越狱评估的 enchmark for reliilit and jailreak halcination valuation(BabyBLUE)。BabyBLUE 引入了各种评估者,以增强现有越狱基准测试,确保输出是有用且恶意的指令。此外,BabyBLUE 提供了一个新数据集,用于增强现有的红队基准测试,特别针对越狱中的幻觉问题,旨在评估被越狱的 LLM 输出对人类社会可能造成的真实危害。
引用
@article{arxiv.2406.11668,
title = {"Not Aligned" is Not "Malicious": Being Careful about Hallucinations of Large Language Models' Jailbreak},
author = {Lingrui Mei and Shenghua Liu and Yiwei Wang and Baolong Bi and Jiayi Mao and Xueqi Cheng},
journal= {arXiv preprint arXiv:2406.11668},
year = {2025}
}
备注
COLING 2025