中文

GAVEL:通过激活监控实现基于规则的安全

人工智能 2026-05-01 v3 密码学与安全 机器学习

摘要

大型语言模型(LLM)正不断与基于激活的监控方法结合,以检测和防止表面文本层面难以察觉的有害行为。然而,现有的激活安全方法基于广泛的误用数据集训练, suffers from 精度不高、灵活性受限和缺乏可解释性等问题。本文引入一种新范式:基于规则的激活安全,灵感来自网络安全中的规则共享实践。我们提出将激活建模为认知元素(Cognitive Elements, CEs),这些是如“构成威胁”和“支付处理”等细粒度、可解释的因素,可以组合来捕捉具有更高精度的特定领域行为。基于此表征,我们提出了实用框架,定义CEs上的谓词规则,并实时检测违规行为。这使实践者能够在无需重新训练模型或检测器的情况下配置和更新安全措施,同时支持透明度和可审计性。我们的实验表明,基于规则的组合式激活安全提高了精度,支持领域定制,为可扩展、可解释且可审计的人工智能治理奠定了基础。我们开源了GAVEL并推出GAVEL Studio,一个交互式规则编 authoring 和管理工具。代码和数据集已在 github.com/Offensive-AI-Lab/gavel 上提供。

关键词

引用

@article{arxiv.2601.19768,
  title  = {GAVEL: Towards Rule-Based Safety Through Activation Monitoring},
  author = {Shir Rozenfeld and Rahul Pankajakshan and Itay Zloczower and Eyal Lenga and Gilad Gressel and Yisroel Mirsky},
  journal= {arXiv preprint arXiv:2601.19768},
  year   = {2026}
}

备注

Accepted to ICLR 2026