Seclens:面向安全漏洞检测的 LLM 角色特定评估
密码学与安全
2026-04-03 v1 人工智能
摘要
现有的 LLM 基于漏洞检测基准将模型性能压缩为单一指标,未能反映不同利益相关者的不同优先事项。例如,CISO 可能强调关键漏洞的高召回率,工程负责人可能优先最小化误报,而 AI 官员可能在能力与成本之间进行平衡。为解决这一限制,我们引入了 Seclens-R,一个围绕 35 个共享维度(分为 7 个测量类别)的多利益相关者评估框架。该框架定义了五个角色特定的加权轮廓:CISO、首席 AI 官、安全研究员、工程部长和 AI-as-Actor。每个轮廓选择 12 到 16 个维度,权重总和为 80,产生一个 0 到 100 之间的综合决策分数。我们将 Seclens-R 应用于评估 12 个前沿模型,在 406 个源自 93 个开源项目的任务数据集上,覆盖 10 个编程语言和 8 个符合 OWASP 标准的漏洞类别。评估在 Code-in-Prompt (CIP) 和 Tool-Use (TU) 两个场景下进行。结果显示,利益相关者视角之间存在显著差异,同一模型的决策分数相差最高可达 31 分。例如,Qwen3-Coder 在工程部长轮廓下获得 A (76.3),但在 CISO 轮廓下仅为 D (45.2),而 GPT-5.4 也显示出类似的差异。这些发现表明,漏洞检测本质上是一个多目标问题,角色感知的评估提供了单一聚合指标掩盖的洞见。
引用
@article{arxiv.2604.01637,
title = {Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection},
author = {Subho Halder and Siddharth Saxena and Kashinath Kadaba Shrish and Thiyagarajan M},
journal= {arXiv preprint arXiv:2604.01637},
year = {2026}
}