BiasJailbreak:分析大语言模型中的伦理偏见与越狱漏洞
计算与语言
2025-11-26 v5 人工智能
机器学习
摘要
尽管大语言模型(LLMs)在各种任务中表现出色,但它们可能存在潜在的安全风险,例如“越狱”(jailbreaks),即恶意输入可迫使 LLMs 生成绕过安全对齐的有害内容。本文深入探讨 LLMs 中的伦理偏见,并检视这些偏见如何被用于越狱。值得注意的是,即使在其他提示部分相同的情况下,这些偏见导致 GPT-4o 模型在非二元和阴性关键词之间的成功率差异可达 20%,在白色和黑色关键词之间的差异可达 16%。我们提出了 BiasJailbreak 概念,强调这些由安全引起的偏见所潜在的风险。BiasJailbreak 通过要求目标 LLM 本身生成偏见关键词来自动生成偏见关键词,并利用这些关键词生成有害输出。此外,我们提出了一种高效防御方法 BiasDefense,通过在生成前注入防御性提示来防止越狱尝试。BiasDefense 作为一种免除生成后额外推理成本的替代方案,例如 Llama-Guard 等 Guard 模型。我们的发现表明,LLMs 中的伦理偏见实际上可能导致生成不安全的输出,并提出一种使 LLMs 更安全和无偏见的方法。为促进进一步的研究和改进,我们开源了 BiasJailbreak 的代码和相关数据,为社区提供了更好地理解和缓解由安全引起的偏见的工具。
引用
@article{arxiv.2410.13334,
title = {BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models},
author = {Isack Lee and Haebin Seong},
journal= {arXiv preprint arXiv:2410.13334},
year = {2025}
}
备注
Accepted as a workshop paper at AAAI 2026