中文

缓解大语言模型中的过度安全行为

计算与语言 2024-08-30 v2

摘要

随着大语言模型(LLMs)日益普及,将模型安全性与实用性相结合变得愈发重要。挑战在于确保LLMs能够识别并拒绝危险提示,同时不牺牲其提供帮助的能力。“过度安全”问题表明这有多么困难。为了减少过度的安全行为——研究发现有26.1%的安全提示被误判为危险提示而遭到拒绝——我们结合XSTest数据集提示以及交互式、上下文和少样本提示,来检验Llama2、Gemma、Command R+和Phi-3等LLMs的决策边界。我们发现少样本提示对Llama2效果最佳,交互式提示对Gemma效果最佳,而上下文提示对Command R+和Phi-3效果最佳。通过结合这些提示策略,我们能够在所有LLMs中将过度安全行为总体缓解92.9%。我们的工作提出了多种提示策略以越狱LLMs的决策过程,使其能够在拒绝不安全提示与保持有用性之间游刃有余。

关键词

引用

@article{arxiv.2405.05418,
  title  = {Mitigating Exaggerated Safety in Large Language Models},
  author = {Ruchira Ray and Ruchi Bhalani},
  journal= {arXiv preprint arXiv:2405.05418},
  year   = {2024}
}

备注

17 pages, 8 figures, 2 tables