中文

CourtGuard:面向 LLM 安全的零样本策略适应模型无关框架

人工智能 2026-02-27 v1 机器学习

摘要

当前的大型语言模型(LLM)安全机制严重依赖静态的、经过微调的分类器,存在适应性刚性问题,即在不进行高成本再训练的情况下无法强制执行新的治理规则。为此,我们引入 CourtGuard,一个基于检索增强的多智能体框架,将安全评估重新构想为“证据辩论”。通过在外部政策文件支撑下进行对抗性辩论,CourtGuard 在 7 个安全基准测试中实现了领先的性能,无需微调即可超越专门的政策遵循基线。除标准指标外,我们还突出了两个关键能力:(1)零样本适应性——我们的框架通过更换参考政策,成功地在出域维基百科破坏任务中实现了 90% 的准确率;(2)自动数据精修与审计——我们利用 CourtGuard 对九个新型对抗攻击数据集进行了精修与审计。我们的结果表明,將安全逻辑从模型权重中解耦,为满足当前及未来人工智能治理中的监管要求,提供了一条稳健、可解释且可适应的路径。

关键词

引用

@article{arxiv.2602.22557,
  title  = {CourtGuard: A Model-Agnostic Framework for Zero-Shot Policy Adaptation in LLM Safety},
  author = {Umid Suleymanov and Rufiz Bayramov and Suad Gafarli and Seljan Musayeva and Taghi Mammadov and Aynur Akhundlu and Murat Kantarcioglu},
  journal= {arXiv preprint arXiv:2602.22557},
  year   = {2026}
}

备注

Under Review