抢答:大语言模型在多轮对话中的安全漏洞
计算与语言
2024-10-31 v2 人工智能
摘要
大语言模型(LLMs)已被证明会生成非法或不道德的回应,特别是在遭受“越狱”攻击时。关于越狱的研究突显了 LLMs 的安全问题。然而,先前的研究主要集中在单轮对话上,忽略了多轮对话所呈现的潜在复杂性和风险,而多轮对话是人类从 LLMs 获取信息的关键模式。在本文中,我们认为人类可以利用多轮对话诱导 LLMs 生成有害信息。即使多轮对话中的每一轮都紧密服务于一个恶意目的,LLMs 也可能不打算拒绝警告性或处于边缘的不安全查询。因此,通过将不安全查询分解为多个子查询以进行多轮对话,我们诱导 LLMs 逐步回答有害的子问题,最终形成整体有害的回应。我们在广泛范围的 LLMs 上进行的实验表明,当前 LLMs 在多轮对话中的安全机制存在不足。我们的发现揭示了 LLMs 在涉及多轮对话的复杂场景中的漏洞,为 LLMs 的安全性提出了新的挑战。
引用
@article{arxiv.2402.17262,
title = {Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue},
author = {Zhenhong Zhou and Jiuyang Xiang and Haopeng Chen and Quan Liu and Zherui Li and Sen Su},
journal= {arXiv preprint arXiv:2402.17262},
year = {2024}
}
备注
working in progress 23pages, 18 figures