缓解大语言模型中的过度安全行为
计算与语言
2024-08-30 v2
摘要
随着大语言模型(LLMs)日益普及,将模型安全性与实用性相结合变得愈发重要。挑战在于确保LLMs能够识别并拒绝危险提示,同时不牺牲其提供帮助的能力。“过度安全”问题表明这有多么困难。为了减少过度的安全行为——研究发现有26.1%的安全提示被误判为危险提示而遭到拒绝——我们结合XSTest数据集提示以及交互式、上下文和少样本提示,来检验Llama2、Gemma、Command R+和Phi-3等LLMs的决策边界。我们发现少样本提示对Llama2效果最佳,交互式提示对Gemma效果最佳,而上下文提示对Command R+和Phi-3效果最佳。通过结合这些提示策略,我们能够在所有LLMs中将过度安全行为总体缓解92.9%。我们的工作提出了多种提示策略以越狱LLMs的决策过程,使其能够在拒绝不安全提示与保持有用性之间游刃有余。
引用
@article{arxiv.2405.05418,
title = {Mitigating Exaggerated Safety in Large Language Models},
author = {Ruchira Ray and Ruchi Bhalani},
journal= {arXiv preprint arXiv:2405.05418},
year = {2024}
}
备注
17 pages, 8 figures, 2 tables