中文

微调后的大语言模型真的理解漏洞吗?对语义陷阱的探究

密码学与安全 2026-05-22 v3 软件工程

摘要

大语言模型(LLM)在软件漏洞检测方面展现出有前景的性能,尤其是在领域特定的监督微调(SFT)之后。然而,尚不清楚这些模型是真正内化了漏洞的根本原因,还是仅仅利用了表面的功能模式。虽然先前的工作记录了预训练或零样本模型的相关失败,但SFT过程本身,以及显式推理监督如何调节它,仍未得到充分探索。我们研究了在普通SFT和带推理监督的SFT下微调的解码器-only LLM,识别出一种我们称之为语义陷阱的失败模式,其特点是三种症状:配对敏感性能、间隙决定决策以及对语义保持变化的脆弱性。为了探测这一点,我们提出了TrapEval,一个评估框架,包含两个真实世界数据集V2P(漏洞代码与补丁代码配对)和V2N(漏洞代码与无关正常代码配对),以及语义扰动、基于CodeBLEU的间隙分析和LLM辅助的推理失败分类法。评估了五个代表性的LLM,它们在有和没有显式推理(思维链)的情况下进行微调。我们的结果表明,普通SFT在未配对数据(V2N)上产生了看似很高的分数,但同时未能通过所有三种症状。模型在V2P上遭受高误报率,在扰动下性能下降,并表现出对漏洞代码和补丁代码之间文本间隙的系统性依赖。使用显式推理进行微调减轻了这些症状,但代价是召回率下降;其缺乏可测量的间隙依赖性部分反映了地板效应,而非逃脱了陷阱。此外,我们的分类法揭示这些模型仍然会误解控制流并幻觉API行为,表明当前的微调减轻了但并未消除对表面特征的依赖。

关键词

引用

@article{arxiv.2601.22655,
  title  = {Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap},
  author = {Feiyang Huang and Yuqiang Sun and Fan Zhang and Ziqi Yang and Han Liu and Yang Liu},
  journal= {arXiv preprint arXiv:2601.22655},
  year   = {2026}
}

备注

16 pages