评估 LLM 安全解决方案的有效性:Palit 基准数据集
密码学与安全
2025-05-21 v2 人工智能
计算与语言
摘要
大型语言模型 (LLM) 正在越来越多地集成到 healthcare 和 finance 等行业的关键系统中。用户可以提交查询给 LLM 启用聊天机器人,其中一些聊天机器人会从存储敏感数据的内部数据库中检索信息来丰富响应。这导致一系列攻击:用户提交恶意查询,LLM 系统输出可能对所有者造成伤害的响应,如泄露内部数据或通过伤害第三方而产生法律责任。虽然正在开发安全工具来抵御这些威胁,但缺乏对其有效性和可用性的正式评估。本研究通过开展彻底的比较分析来填补这一空白。我们识别了 13 个解决方案 (9 个闭源、4 个开源),但仅评估了 7 个,因为专有模型所有者缺乏参与。为评估,我们构建了恶意提示基准数据集,并以 ChatGPT-3.5-Turbo 基线模型为基准评估这些工具的性能。我们的结果表明,基线模型的误报率过高,无法用于此任务。Lakera Guard 和 ProtectAI LLM Guard 成为表现最佳的整体工具,展示了可用性与性能之间的权衡。本研究得出结论,建议在闭源供应商之间提高透明度,改进情境感知检测,增强开源参与,提高用户意识,并采用更具代表性的绩效指标。
引用
@article{arxiv.2505.13028,
title = {Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset},
author = {Sayon Palit and Daniel Woods},
journal= {arXiv preprint arXiv:2505.13028},
year = {2025}
}