语义记忆与灵敏性:检验语义召回对长上下文代码推理的影响
计算与语言
2026-04-21 v4 机器学习
软件工程
摘要
大型语言模型(LLMs)日益被用于理解大型代码库,但它们是否理解长代码上下文的运算语义,或仅依赖模式匹配捷径尚不明确。我们区分了词典记忆(retrieving code verbatim)与语义记忆(understanding operational semantics)。在评估 10 个最先进 LLMs后发现,虽然前沿模型实现近乎完美、位置无关的词典记忆,但当代码在长上下文中居中时,语义记忆会严重退化。我们提出语义记忆灵敏性,用于衡量任务是否需要理解代码的运算语义,抑或可允许模式匹配捷径。通过一种新颖的反事实测量方法,我们展示模型严重依赖模式匹配捷径来解决现有代码理解基准测试。我们提出了一个新任务 SemTrace,通过不可预测的操作实现高语义记忆灵敏性;LLMs 的准确率在位置上表现出严重效应,随着相关代码片段接近输入代码上下文中部位,其准确率下降幅度中位值为 92.73%,而 CRUXEval 的下降幅度仅为 53.36%。我们的发现表明,当前的评估显著低估了长上下文代码理解中语义记忆失败的程度。
引用
@article{arxiv.2505.13353,
title = {Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Reasoning},
author = {Adam Štorek and Mukur Gupta and Samira Hajizadeh and Prashast Srivastava and Suman Jana},
journal= {arXiv preprint arXiv:2505.13353},
year = {2026}
}
备注
Accepted to ACL 2026 (main)