LLM 的在线安全分析:基准、评估与未来路径
软件工程
2024-04-15 v1 人工智能
计算与语言
密码学与安全
机器学习
摘要
尽管大型语言模型(LLM)在众多领域获得了广泛应用,但其有限的可解释性从真实性、鲁棒性和公平性等多个方面引发了对其安全运行的担忧。近期研究开始开发针对 LLM 的质量保证方法,引入了基于离线检测器的方法或不确定性估计等技术。然而,这些方法主要集中于生成后分析,使得 LLM 在生成阶段的在线安全分析成为尚未探索的领域。为了填补这一空白,我们在本文中对现有 LLM 在线安全分析方法的有效性进行了全面评估。我们首先进行了一项初步研究,验证了在生成早期过程中检测不安全输出的可行性。随后,我们建立了首个公开可用的 LLM 在线安全分析基准,涵盖了广泛的方法、模型、任务、数据集和评估指标。利用该基准,我们广泛分析了最先进的在线安全分析方法在开源和闭源 LLM 上的性能。该分析揭示了各方法的优势与不足,并基于具体应用场景和任务要求为选择最合适的方法提供了宝贵见解。此外,我们还探索了使用混合方法(即结合多种方法以得出综合安全结论)的潜力,以增强 LLM 在线安全分析的有效性。我们的发现为开发创新且可信的 LLM 质量保证方法指明了有前景的方向,有助于其在不同领域的可靠部署。
引用
@article{arxiv.2404.08517,
title = {Online Safety Analysis for LLMs: a Benchmark, an Assessment, and a Path Forward},
author = {Xuan Xie and Jiayang Song and Zhehua Zhou and Yuheng Huang and Da Song and Lei Ma},
journal= {arXiv preprint arXiv:2404.08517},
year = {2024}
}