思考的成本:大语言模型中越狱风险的增加
计算与语言
2025-08-15 v1 人工智能
摘要
思考模式一直被视为LLM中最宝贵的模式之一。然而,我们发现了一个意想不到的且此前被忽视的现象:具有思考模式的LLM更容易被越狱攻击破解。我们在AdvBench和HarmBench上评估了9个LLM,发现具有思考模式的LLM被攻击成功的成功率几乎高于非思考模式。通过大量样本研究发现,出于教育目的以及过度长的思考长度是成功攻击数据的特征,LLM在大多数情况下会在知道问题有害时给出有害答案。为缓解上述问题,本文提出了一种用于LLM的安全思考干预方法,通过在提示中添加LLM的"特定思考标记",显式引导LLM的内部思考过程。结果表明,安全思考干预可以显著降低具有思考模式的LLM的攻击成功率。
引用
@article{arxiv.2508.10032,
title = {The Cost of Thinking: Increased Jailbreak Risk in Large Language Models},
author = {Fan Yang},
journal= {arXiv preprint arXiv:2508.10032},
year = {2025}
}