中文

DCE-LLM:基于大语言模型的死代码消除

计算与语言 2026-03-10 v3

摘要

死代码给软件开发带来了诸多挑战,例如增加二进制文件体积和维护困难。它还可能掩盖逻辑错误,并被恶意软件用于代码混淆。对于基于 LLM 的代码相关任务,死代码引入了可能误导这些模型的漏洞,引发了安全担忧。尽管现代编译器和 IDE 提供了死代码消除功能,但复杂的模式可以绕过这些工具。需要一种包含分类、定位、解释和修正的通用方法,然而现有工具通常需要大量人工操作。我们提出了 DCE-LLM,这是一个使用小型 CodeBERT 模型结合基于归因的行选择器来高效定位可疑代码的自动化死代码消除框架。随后,LLM 在大规模标注的死代码数据集上进行微调,以生成判断和解释,提供详细的说明和补丁。DCE-LLM 优于现有工具,具备高级的不可达性检测、自动修正以及对多种编程语言的支持。实验结果表明,DCE-LLM 在未使用和不可达代码上取得了超过 94% 的 F1 分数,显著超越 GPT-4o 达 30%。

关键词

引用

@article{arxiv.2506.11077,
  title  = {CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling},
  author = {Chongyu Fan and Yihua Zhang and Jinghan Jia and Alfred Hero and Sijia Liu},
  journal= {arXiv preprint arXiv:2506.11077},
  year   = {2026}
}

备注

Accepted to ICLR 2026