中文

CodeAttack:通过代码补全揭示大语言模型的安全泛化挑战

计算与语言 2024-09-17 v5 人工智能 密码学与安全 机器学习 软件工程

摘要

大语言模型(LLMs)的快速发展带来了卓越的生成能力,但也引发了对其潜在滥用的担忧。虽然监督微调和基于人类反馈的强化学习等策略增强了它们的安全性,但这些方法主要关注自然语言,可能无法泛化到其他领域。本文介绍了 CodeAttack,一个将自然语言输入转化为代码输入的框架,为测试 LLMs 的安全泛化能力提供了一个新颖的环境。我们对包括 GPT-4、Claude-2 和 Llama-2 系列在内的最先进 LLMs 的综合研究揭示了这些模型在面对代码输入时一个普遍存在的安全漏洞:CodeAttack 在超过 80% 的情况下绕过了所有模型的安全护栏。我们发现,CodeAttack 与自然语言之间的分布差距越大,安全泛化能力就越弱,例如使用数据结构对自然语言输入进行编码。此外,我们提出了关于 CodeAttack 成功原因的假设:LLMs 在代码训练过程中习得了错位的偏好,即优先考虑代码补全而非规避潜在的安全风险。最后,我们分析了潜在的缓解措施。这些发现凸显了代码领域新的安全风险,以及需要更鲁棒的安全对齐算法来匹配 LLMs 的代码能力。

关键词

引用

@article{arxiv.2403.07865,
  title  = {CodeAttack: Revealing Safety Generalization Challenges of Large Language Models via Code Completion},
  author = {Qibing Ren and Chang Gao and Jing Shao and Junchi Yan and Xin Tan and Wai Lam and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2403.07865},
  year   = {2024}
}

备注

ACL Findings 2024, Code is available at https://github.com/renqibing/CodeAttack