通过幽默绕过 LLM 的安全防护
计算与语言
2025-04-10 v1 机器学习
摘要
本文展示了通过包含不安全请求的幽默提示可绕过大语言模型(LLM)的安全防护的可能性。具体而言,我们的方法不编辑不安全请求,也遵循固定模板——实施简单,不需要额外的 LLM 来 crafting 提示。广泛的实验表明,该方法在不同 LLM 上的有效性。我们还指出,移除或增加更多幽默都会降低其有效性——过度的幽默可能会分散 LLM 对完成其不安全请求的注意力。因此,我们认为,当对不安全请求的关注度与幽默存在适当平衡时,才会发生 LLM 的越狱。
引用
@article{arxiv.2504.06577,
title = {Bypassing Safety Guardrails in LLMs Using Humor},
author = {Pedro Cisneros-Velarde},
journal= {arXiv preprint arXiv:2504.06577},
year = {2025}
}