低资源语言越狱 GPT-4
计算与语言
2024-01-30 v2 人工智能
密码学与安全
机器学习
摘要
AI 安全训练与大型语言模型(LLMs)的红队测试是减轻不安全内容生成的措施。我们的工作通过将被翻译为低资源语言的不安全英文输入成功绕过 GPT-4 的防护机制,揭示了这些安全机制固有的跨语言脆弱性,其源于安全训练数据的不平等语言分布。在 AdvBenchmark 上,GPT-4 对不安全的翻译输入作出回应,并在 79% 的情况下提供可使用户朝其有害目标推进的可操作项,这与最先进的越狱攻击相当甚至超越。其他高/中资源语言的攻击成功率显著更低,表明跨语言脆弱性主要作用于低资源语言。此前,低资源语言训练的不足主要影响这些语言的使用者,造成技术鸿沟。然而,我们的工作强调了一个关键转变:这一缺陷如今对所有 LLMs 用户构成风险。公开可用的翻译 API 使任何人都能利用 LLMs 的安全漏洞。因此,我们的工作呼吁开展更全面的红队测试工作,以开发具有广泛语言覆盖的鲁棒多语言防护机制。
引用
@article{arxiv.2310.02446,
title = {Low-Resource Languages Jailbreak GPT-4},
author = {Zheng-Xin Yong and Cristina Menghini and Stephen H. Bach},
journal= {arXiv preprint arXiv:2310.02446},
year = {2024}
}
备注
NeurIPS Workshop on Socially Responsible Language Modelling Research (SoLaR) 2023. Best Paper Award