中文

ALRPHFS:基于对抗学习风险模式与分层快慢推理的鲁棒智能体防御

密码学与安全 2025-09-16 v2

摘要

LLM 智能体正日益成为智能系统的核心。然而,其部署引发了严重的安全隐患。现有的防御手段主要依赖“安全检查”,这难以捕捉有害用户输入或不安全智能体行为所构成的复杂语义风险——在安全检查与现实风险之间造成了显著的语义鸿沟。为了弥合这一鸿沟,我们提出了一种新颖的防御框架 ALRPHFS(基于对抗学习风险模式与分层快慢推理)。ALRPHFS 包含两个核心组件:(1)一个离线对抗自学习循环,用于迭代地精炼出一个可泛化且平衡的风险模式库,在无需重训基础 LLM 的情况下大幅增强鲁棒性;(2)一个在线分层快慢推理引擎,在检测有效性与计算效率之间取得平衡。实验结果表明,与现有基线相比,我们的方法实现了更优的总体性能,取得了同类最佳的 80% 平均准确率,并在跨智能体和跨任务上展现出强大的泛化能力。

关键词

引用

@article{arxiv.2505.19260,
  title  = {ALRPHFS: Adversarially Learned Risk Patterns with Hierarchical Fast \& Slow Reasoning for Robust Agent Defense},
  author = {Shiyu Xiang and Tong Zhang and Ronghao Chen},
  journal= {arXiv preprint arXiv:2505.19260},
  year   = {2025}
}

备注

EMNLP 2025 findings, 20 pages, 2 figures