中文

揭示神经代码模型中的项目特定偏置

人工智能 2024-03-12 v2 软件工程

摘要

深度学习已在诸多软件分析任务中带来显著改进。尽管基于大语言模型(LLMs)的神经代码模型在项目的独立同分布(IID)设置下训练与测试时表现出令人称赞的性能,它们往往难以有效泛化到现实世界中项目间的分布外(OOD)数据。本文表明,该现象源于模型重度依赖项目特定的捷径进行预测,而非基于真实证据。我们提出一种 Cond-Idf 度量来解释此行为,其量化了词元与标签的相关性及其项目特定程度。模型行为与所提度量的强相关性表明,若无恰当正则化,模型倾向于利用虚假统计线索进行预测。基于这些观察,我们提出一种新颖的偏置缓解机制,通过利用样本间潜在的逻辑关系来正则化模型的学习行为。在两个具代表性的程序分析任务上的实验结果表明,我们的缓解框架可同时提升项目间 OOD 泛化能力与对抗鲁棒性,且不牺牲项目内 IID 数据上的准确率。

关键词

引用

@article{arxiv.2201.07381,
  title  = {Unveiling Project-Specific Bias in Neural Code Models},
  author = {Zhiming Li and Yanzhou Li and Tianlin Li and Mengnan Du and Bozhi Wu and Yushi Cao and Junzhe Jiang and Yang Liu},
  journal= {arXiv preprint arXiv:2201.07381},
  year   = {2024}
}

备注

Accepted by LREC-COLING 2024