中文

论针对大语言模型对抗攻击传统漏洞评分系统的有效性

密码学与安全 2024-12-31 v1 人工智能

摘要

本研究探讨了既定漏洞指标(如通用漏洞评分系统(CVSS))在评估针对大语言模型(LLM)的攻击(Adversarial Attacks, AAs)方面的有效性,聚焦于对抗攻击。该研究提供了关于如何增强这些指标的新视角。本研究采用定量方法,计算并比较了针对LLM上56种对抗攻击的漏洞得分系数变异。这些攻击来源于各种研究论文,经通过在线数据库获取,均采用多种漏洞指标进行评估。得分由三个不同LLM的平均值确定。结果表明,既定评分系统对不同攻击的漏洞得分变化最小,表明许多指标因素不足以评估LLM上的对抗攻击,尤其是那些具有刚性价值集的特定因素(如CVSS中的因素)。这些发现支持了当前漏洞指标(尤其是具有刚性价值的指标)在评估LLM上的对抗攻击方面受限的假设,凸显了开发更灵活、更通用的针对此类攻击的指标的必要性。该研究通过大量测试和计算,概述了既定漏洞指标的有效性和适用性,尤其是在近年来广受关注的大语言模型对抗攻击方面。通过广泛测试,本研究概述了这些指标的局限性,为改进和细化面向LLM的漏洞评估框架开辟了新路径。

关键词

引用

@article{arxiv.2412.20087,
  title  = {On the Validity of Traditional Vulnerability Scoring Systems for Adversarial Attacks against LLMs},
  author = {Atmane Ayoub Mansour Bahar and Ahmad Samer Wazan},
  journal= {arXiv preprint arXiv:2412.20087},
  year   = {2024}
}

备注

101 pages, 3 figures