中文

所见未必所得:评估 GPT 对源代码的理解

软件工程 2025-11-18 v3 人工智能 机器学习

摘要

近期研究表明,大语言模型(LLM)在软件工程任务中展现出卓越能力,包括代码生成与理解。尽管 LLM 在辅助编程方面显示出巨大潜力,但它们对对抗攻击十分脆弱。本文研究了 LLM 对不可感知攻击的脆弱性。此类攻击在字符层面操控源代码,使更改对人类评审者不可见,却能有效误导 LLM 的行为。我们将这些攻击分为四种不同类别,并分析其对代码分析与理解任务的影响。这四类不可感知字符攻击包括代码重排、不可见编码字符、代码删除和代码同形字。为评估最先进 LLM 的鲁棒性,我们在多个模型上进行了系统性评估,使用了扰动和干净代码片段两种数据。我们引入了两个评估指标:基于响应对数概率的模型置信度和响应正确性。结果表明 LLM 易受不可感知代码扰动的影响,不同 LLM 的性能退化程度各异。此外,我们观察到扰动幅度与模型性能之间存在一致的负相关关系。这些结果凸显了对能够在不可感知对抗条件下稳健运作的 LLM 的迫切需求。

关键词

引用

@article{arxiv.2412.08098,
  title  = {What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code},
  author = {Jiawen Wen and Bangshuo Zhu and Huaming Chen},
  journal= {arXiv preprint arXiv:2412.08098},
  year   = {2025}
}

备注

This work has been accepted at APSEC 2025