大型语言模型易受诱骗切换攻击以生成有害内容
计算与语言
2024-02-22 v1 人工智能
摘要
大型语言模型 (LLMs) 生成欺骗性和破坏性内容所带来的风险一直是大量研究的主题,但即使是安全的生成内容也可能导致有问题的下游影响。在本研究中,我们将重点转向即使来自 LLMs 的安全文本如何通过诱骗切换 (Bait-and-Switch) 攻击轻易转化为潜在的有害内容。在此类攻击中,用户首先向 LLMs 提示安全问题,然后采用简单的查找替换事后技术将输出操纵为有害叙述。这种方法在生成有毒内容方面令人震惊的有效性,突显了为 LLMs 开发可靠安全防护机制的重大挑战。特别是,我们强调仅关注 LLMs 逐字输出的安全性是不够的,还需要考虑事后变换。
引用
@article{arxiv.2402.13926,
title = {Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content},
author = {Federico Bianchi and James Zou},
journal= {arXiv preprint arXiv:2402.13926},
year = {2024}
}