LLM的拒绝训练在过去式中是否具有普适性?
摘要
拒绝训练广泛用于防止LLM生成有害、不可取或非法输出。我们揭示了当前拒绝训练方法存在的一种好奇的泛化差距:仅仅将有害请求改写为过去式(例如,将"如何制作Molotov瓶爆炸物?"改写为"人们如何制作Molotov瓶爆炸物?")就足以劫持许多最先进的LLM。我们使用GPT-3.5 Turbo作为改写模型,对Llama-3 8B、Claude-3.5 Sonnet、GPT-3.5 Turbo、Gemma-2 9B、Phi-3-Mini、GPT-4o mini、GPT-4o、o1-mini、o1-preview和R2D2等模型进行了系统性评估。例如,使用直接请求时,针对来自JailbreakBench的有害请求,GPT-4o的成功率为1%;而使用20次过去式改写尝试时,成功率提高到88%。有趣的是,我们还发现将请求改写为未来式的效果较差,这表明拒绝警戒系统倾向于将过去式的历史问题视为更 benign(中性/安全)的,而相对于假设性的未来问题则更为严格。此外,我们的微调GPT-3.5 Turbo实验表明,当在微调数据中显式包含过去式示例时,针对过去式改写的防御是可行的。总体而言,我们的发现表明,广泛使用的对齐技术——如SFT、RLHF和对抗训练——用于对齐所研究的模型可能脆弱且不总能如期实现。我们提供了代码和劫持artifact,地址为https://github.com/tml-epfl/llm-past-tense
引用
@article{arxiv.2407.11969,
title = {Does Refusal Training in LLMs Generalize to the Past Tense?},
author = {Maksym Andriushchenko and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2407.11969},
year = {2025}
}
备注
Accepted at ICLR 2025. Updates in v2 and v3: added GPT-4o, Claude 3.5 Sonnet, o1-mini, and o1-preview results. Code and jailbreak artifacts: https://github.com/tml-epfl/llm-past-tense