中文

Speak Easy:通过简单交互从 LLM 滥用有害越狱

机器学习 2025-08-05 v3 人工智能 计算与语言 计算机与社会

摘要

尽管进行了广泛的安全对齐工作,大语言模型 (LLM) 仍然对能够激发有害行为的越狱攻击保持脆弱性。虽然现有研究主要关注需要技术专长的攻击方法,但仍有两个关键问题未被充分探讨:(1) 滥用有害越狱的响应是否真正有效帮助普通用户实施有害行动?(2) 是否存在更常见、简单的人类-LLM 交互中的安全漏洞?本文证明,LLM 响应在既可操作又信息丰富时,最能有效地促成有害行动——这两种属性易于在多步骤、多语言交互中被激发。我们提出 HarmScore,用于衡量 LLM 响应是否有效启用有害行动的指标,并设计 Speak Easy,一种简单的多步骤、多语言攻击框架。值得注意的是,在四个安全基准测试中,无论是开源还是专有 LLM,纳入 Speak Easy 后,对抗成功率和 HarmScore 分别实现平均绝对提升 0.319 和 0.426。我们的工作揭示了一个关键且常被忽视的漏洞:恶意用户可轻易利用常见的交互模式实现有害意图。

关键词

引用

@article{arxiv.2502.04322,
  title  = {Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions},
  author = {Yik Siu Chan and Narutatsu Ri and Yuxin Xiao and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2502.04322},
  year   = {2025}
}

备注

ICML 2025