中文

使用阿拉伯语音音转写和阿拉比兹治理 LLM

机器学习 2024-10-04 v2 计算与语言

摘要

本研究识别了大型语言模型(LLM)对 'jailbreak' 攻击的潜在漏洞,特别关注阿拉伯语及其各种形式。虽然大多数研究集中在英语基础的提示操控上,但我们的调查扩展范围,探讨阿拉伯语。我们最初在标准阿拉伯语中测试了 AdvBench 基准,发现即使采用前缀注入等提示操控技术,也不足以促使 LLM 生成不安全内容。然而,当使用阿拉伯语语音转写和聊天语(arabizi)时,我们发现可在 OpenAI GPT-4 和 Anthropic Claude 3 Sonnet 等平台上生成不安全内容。我们的发现表明,使用阿拉伯语及其各种形式可能暴露可能保持隐藏的信息,potentially 增加 jailbreak 攻击的风险。我们假设,这种暴露可能是由于模型对特定单词的学习关联所致,凸显了需要在所有语言形式中进行更全面安全训练的必要性。

关键词

引用

@article{arxiv.2406.18725,
  title  = {Jailbreaking LLMs with Arabic Transliteration and Arabizi},
  author = {Mansour Al Ghanim and Saleh Almohaimeed and Mengxin Zheng and Yan Solihin and Qian Lou},
  journal= {arXiv preprint arXiv:2406.18725},
  year   = {2024}
}

备注

Accepted by EMNLP 2024