中文

AgentDoG 1.5:面向AI代理安全与安全的轻量级可扩展对齐框架

人工智能 2026-05-29 v1 计算与语言 密码学与安全 计算机视觉与模式识别 机器学习

摘要

现代开放世界代理如OpenClaw展现出强大的跨环境执行能力,却引入了更广泛的安全风险源。而且,先进的前沿AI模型大幅降低了攻击门槛,使得当前代理对齐框架不足以应用于实际部署。为应对这些新兴威胁,我们提出一种轻量级可扩展的代理安全对齐框架。具体而言,我们更新了代理安全分类学,以适应Codex和OpenClaw执行场景中新出现的风险。我们进一步构建基于分类学引导的数据引擎,采用影响函数净化技术,在仅使用约1000个样本的情况下训练轻量级AgentDoG 1.5变体(参数量为0.8B、2B、4B和8B),实现了与领先闭源模型(如GPT-5.4)相当的性能。基于AgentDoG 1.5,我们构建了高度高效的代理级安全SFT和RL训练环境,该环境在Docker级环境中的部署开销降低了两个数量级。最后,我们将AgentDoG 1.5部署为训练-free的在线护栏,用于实时安全监控。大量实验结果表明,AgentDoG 1.5在多样化且复杂的交互式代理场景中实现了业界领先的性能。所有模型和数据集均公开释放。

关键词

引用

@article{arxiv.2605.29801,
  title  = {AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security},
  author = {Dongrui Liu and Yu Li and Zhonghao Yang and Peng Wang and Guanxu Chen and Yuejin Xie and Qinghua Mao and Wanying Qu and Yanxu Zhu and Tianyi Zhou and Leitao Yuan and Zhijie Zheng and Qihao Lin and Yimin Wang and Haoyu Luo and Shuai Shao and Chen Qian and Qingyu Liu and Ling Tang and Ruiyang Qin and Qihan Ren and Junxiao Yang and Kun Wang and Zhiheng Xi and Linfeng Zhang and Ranjie Duan and Bo Zhang and Wenjie Wang and Wen Shen and Qiaosheng Zhang and Yan Teng and Chaochao Lu and Rui Mei and Man Li and Jialing Tao and Xi Lin and Tianhang Zheng and Yong Liu and Quanshi Zhang and Lei Zhu and Xingjun Ma and Junhua Liu and Hui Xue and Xiaoxiang Zuo and Xiangnan He and Chao Shen and Xianglong Liu and Minlie Huang and Jing Shao and Xia Hu},
  journal= {arXiv preprint arXiv:2605.29801},
  year   = {2026}
}

备注

44 pages, 12 Figures, 9 Tables