中文

暗型大语言模型:Unaligned AI 模型的日益增长威胁

计算与语言 2025-05-16 v1 人工智能 密码学与安全 机器学习

摘要

大型语言模型(LLMs)正快速重塑现代生活,推动了从医疗保健到教育等众多领域的进步。然而,尽管这些模型拥有卓越的能力,但也隐藏着一个重大威胁:它们对jailbreak攻击的脆弱性。大语言模型受到jailbreak攻击的根本漏洞,源于它们所学习的数据本身。只要训练数据中包含未经筛选的、有问题的或“暗”内容,这些模型就可能本质上学习到不 desirable 的模式或弱点,使用户能够绕过其原本的安全控制。我们的研究识别了由大语言模型构成的日益增长威胁,这些模型被刻意设计为不包含伦理边界,或通过jailbreak技术进行修改。在我们的研究中,我们发现了一种通用jailbreak攻击,有效地破坏了多种最先进的模型,使其在请求时几乎可以回答任何问题并产生有害输出。我们攻击的核心思想已在七个月前在线上公布。然而,许多测试过的大语言模型仍然对该攻击保持脆弱。尽管我们进行了负责任的披露,但来自主要大语言模型提供商的响应往往不充分,凸显了行业在AI安全方面的一项令人担忧的差距。随着模型训练变得更加便宜且更加普及,以及开源大语言模型的 proliferation,滥用风险将不断上升。若不采取决定性的干预,大语言模型可能会继续民主化危险知识的获取,给予的风险将超过人们的预期。

关键词

引用

@article{arxiv.2505.10066,
  title  = {Dark LLMs: The Growing Threat of Unaligned AI Models},
  author = {Michael Fire and Yitzhak Elbazis and Adi Wasenstein and Lior Rokach},
  journal= {arXiv preprint arXiv:2505.10066},
  year   = {2025}
}