中文

CodeS:面向分布偏移下代码模型泛化的基准

软件工程 2023-02-07 v2 人工智能

摘要

分布偏移因导致意外的准确率下降,一直是深度学习(DL)模型可靠部署的长期挑战。尽管在大数据代码时代,DL正成为大规模源代码分析的驱动力,但针对源代码任务的分布偏移分析与基准测试进展有限。为填补此空白,本文首创性地提出CodeS,一个用于源代码学习的分布偏移基准数据集。具体而言,CodeS支持两种编程语言(Java和Python)与五种偏移类型(任务、程序员、时间戳、词元与具体语法树)。基于CodeS的大量实验揭示:1)其他领域(如计算机视觉)的的分布外检测器不能泛化至源代码;2)所有代码分类模型均受分布偏移影响;3)基于表示的偏移比其他偏移对模型影响更大;4)预训练双模态模型对分布偏移相对更具抵抗力。

关键词

引用

@article{arxiv.2206.05480,
  title  = {CodeS: Towards Code Model Generalization Under Distribution Shift},
  author = {Qiang Hu and Yuejun Guo and Xiaofei Xie and Maxime Cordy and Lei Ma and Mike Papadakis and Yves Le Traon},
  journal= {arXiv preprint arXiv:2206.05480},
  year   = {2023}
}

备注

accepted by ICSE'23-NIER