JavelinGuard:用于大语言模型安全的低成本Transformer架构
机器学习
2025-06-10 v1 人工智能
密码学与安全
摘要
我们提出了JavelinGuard,一套专为生产部署优化的低成本、高性能模型架构,用于检测大语言模型(LLM)交互中的恶意意图。Transformer架构的最新进展,包括紧凑型BERT(Devlin等人,2019)变体(例如ModernBERT(Warner等人,2024)),使我们能够构建仅约4亿参数的高精度分类器,即使在标准CPU硬件上也能实现快速推理速度。我们系统地探索了五种逐步复杂的基于Transformer的架构:Sharanga(基线Transformer分类器)、Mahendra(增强注意力加权池化与更深头)、Vaishnava和Ashwina(混合神经集成架构)以及Raudra(具有专门损失函数的先进多任务框架)。我们的模型在九个多样化的对抗性数据集上进行了严格基准测试,包括NotInject系列、BIPIA、Garak、ImprovedLLM、ToxicChat、WildGuard等流行数据集,以及我们新引入的JavelinBench,该数据集专门用于测试具有挑战性的边界和难负样本的泛化能力。此外,我们将我们的架构与领先的开源护栏模型以及大型仅解码器LLM(如gpt-4o)进行了比较,展示了在准确性和延迟方面优越的性价比权衡。我们的研究结果表明,虽然Raudra的多任务设计总体上提供了最稳健的性能,但每种架构在速度、可解释性和资源需求方面都呈现出独特的权衡,为从业者在现实世界的LLM安全应用中选择复杂性与效率的最佳平衡提供了指导。
引用
@article{arxiv.2506.07330,
title = {JavelinGuard: Low-Cost Transformer Architectures for LLM Security},
author = {Yash Datta and Sharath Rajasekar},
journal= {arXiv preprint arXiv:2506.07330},
year = {2025}
}
备注
16 pages, 1 Figure and 5 Tables