HumorReject:通过一点幽默将 LLM 安全与拒绝前缀解耦
机器学习
2025-11-11 v3 密码学与安全
摘要
大型语言模型(LLM)通常依赖显式的拒绝前缀进行安全控制,容易受到前缀注入攻击。我们提出了 HumorReject,这是一种新颖的数据驱动方法,通过幽默作为间接拒绝策略来重新构想 LLM 安全,从而将其与拒绝前缀解耦。与其明确拒绝有害指令,不如用上下文相关的幽默作出回应,以自然化解潜在危险的请求。我们的方法有效解决了常见的“过度防御”问题,并在各种攻击向量方面表现出优越的鲁棒性。我们的发现表明,在实现有效的 LLM 安全方面,训练数据设计的改进与对齐算法本身同样重要。代码和数据集均可在 https://github.com/wooozihui/HumorReject 获取。
引用
@article{arxiv.2501.13677,
title = {HumorReject: Decoupling LLM Safety from Refusal Prefix via A Little Humor},
author = {Zihui Wu and Haichang Gao and Jiacheng Luo and Zhaoxiang Liu},
journal= {arXiv preprint arXiv:2501.13677},
year = {2025}
}