输出长度对 DeepSeek-R1 在强制思考情境下安全性的影响
计算与语言
2025-03-05 v1 人工智能
摘要
大型语言模型(LLM)已展示出强大的推理能力,但在对抗性情境下的安全性仍是一个挑战。本研究考察了输出长度对 DeepSeek-R1 鲁棒性的影响,尤其是在强制思考情境下。我们分析了各种对抗提示下的回复,发现虽然更长的输出可以通过自我纠正提高安全性,但某些攻击类型会利用扩展的生成进行攻击。我们的发现表明,应动态控制输出长度,以平衡推理效果和安全性。我们提出了基于强化学习的策略调整和自适应 token 长度调节,以增强 LLM 的安全性。
引用
@article{arxiv.2503.01923,
title = {Output Length Effect on DeepSeek-R1's Safety in Forced Thinking},
author = {Xuying Li and Zhuo Li and Yuji Kosuga and Victor Bian},
journal= {arXiv preprint arXiv:2503.01923},
year = {2025}
}