中文

安全可控性是您需要的一切

密码学与安全 2025-08-22 v4

摘要

生成式人工智能 (GenAI) 在应用中的采用不可避免地扩大了攻击面,结合新的安全威胁与传统威胁。因此,众多研究和产业 initiative 旨在通过开发评估方法和设计防御措施来缓解与 GenAI 相关的安全威胁。然而,尽管大多数 GenAI 安全工作聚焦于通用威胁(例如“如何制造炸弹”),但关于 application-level 安全以及如何评估和缓解的讨论显著不足。因此,在本工作中,我们采用以 application 为中心的方法来进行 GenAI 安全,并指出尽管大型语言模型 (LLM) 无法保护免受 ad-hoc application specific威胁,却可为应用程序提供保护自己免受此类威胁的框架。我们的第一个贡献是定义安全可控性 - 一种新的 LLM 安全措施,评估模型遵守系统提示中定义的严格警戒线的能力(例如“请勿讨论我们公司的竞争对手”)。这些警戒线在有效的情况下,可在恶意用户试图规避应用目的时阻止威胁。我们的第二个贡献是衡量 LLM 安全可控性的方法,利用新开发的基准 VeganRibs 来评估 LLM 在恶意用户通过包含攻击加速器(越狱和扰动)的提示注入攻击试图规避警戒线时 LLM 对特定警戒线的行为。使用新的基准,我们分析了 18 个开源 LLM,展示了它们之间的安全可控性存在显著差异,这些差异并非寻求到的...(文本被截断)

关键词

引用

@article{arxiv.2504.19521,
  title  = {Security Steerability is All You Need},
  author = {Itay Hazan and Idan Habler and Ron Bitton and Itsik Mantin},
  journal= {arXiv preprint arXiv:2504.19521},
  year   = {2025}
}