通过思维链增强对抗性攻击
计算与语言
2024-10-30 v1
摘要
大型语言模型(LLMs)在各个领域展示了令人印象深刻的性能,但仍然容易受到安全问题的影响。先前的研究表明,基于梯度的对抗性攻击对对齐的 LLMs 特别有效,而思维链(CoT)提示可以通过逐步推理引出期望的答案。本文提出通过将 CoT 提示与贪婪坐标梯度(GCG)技术相结合,增强对对齐 LLMs 的对抗性攻击的鲁棒性。使用 CoT 触发器代替肯定性目标,可以激发后端 LLMs 的推理能力,从而提高对抗性攻击的可迁移性和通用性。我们进行了一项消融研究,将我们的 CoT-GCG 方法与 Amazon Web Services 的 auto-cot 进行了比较。结果表明,我们的方法优于基线 GCG 攻击和 CoT 提示。此外,我们使用 Llama Guard 来评估潜在的有害交互,与将输出与拒绝短语匹配相比,这提供了对整个对话更客观的风险评估。本文代码可在 https://github.com/sujingbo0217/CS222W24-LLM-Attack 获取。
引用
@article{arxiv.2410.21791,
title = {Enhancing Adversarial Attacks through Chain of Thought},
author = {Jingbo Su},
journal= {arXiv preprint arXiv:2410.21791},
year = {2024}
}