中文

基于对抗蒸馏的检索增强型恶意意图检测守卫模型

密码学与安全 2025-11-04 v3 人工智能 机器学习

摘要

随着大型语言模型(LLM)在交互式应用中的部署,线上恶意意图检测变得越来越关键。然而,现有方法不足以实时处理多样化且复杂的用户查询。为此,我们引入 ADRAG(Adversarial Distilled Retrieval-Augmented Guard),一个用于稳健高效线上恶意意图检测的两阶段框架。在训练阶段,高容量教师模型在对抗扰动的检索增强输入上进行训练,以学习在多样化复杂用户查询上的鲁棒决策边界。在推理阶段,蒸馏调度器将教师的知识传递给紧凑的学生模型,同时更新在线收集的知识库。在部署时,紧凑的学生模型利用从在线更新的知识库中检索到的 Top-K 最相似安全示例,实现线上和实时恶意查询检测。跨十个安全基准的评估显示,ADRAG 以 1.49 亿参数模型实现了 WildGuard-7B 98.5% 的性能, 在 OOD 检测方面超越 GPT-4 高出 3.3% 和 Llama-Guard-3-8B 高出 9.5%,同时在实时应用中实现 300 条每秒(QPS)的吞吐量,延迟降低最高可达 5.6 倍。

关键词

引用

@article{arxiv.2509.14622,
  title  = {Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection},
  author = {Yihao Guo and Haocheng Bian and Liutong Zhou and Ze Wang and Zhaoyi Zhang and Francois Kawala and Milan Dean and Ian Fischer and Yuantao Peng and Noyan Tokgozoglu and Ivan Barrientos and Riyaaz Shaik and Rachel Li and Chandru Venkataraman and Reza Shifteh Far and Moses Pawar and Venkat Sundaranatha and Michael Xu and Frank Chu},
  journal= {arXiv preprint arXiv:2509.14622},
  year   = {2025}
}