CodeS:面向分布偏移下代码模型泛化的基准
软件工程
2023-02-07 v2 人工智能
摘要
分布偏移因导致意外的准确率下降,一直是深度学习(DL)模型可靠部署的长期挑战。尽管在大数据代码时代,DL正成为大规模源代码分析的驱动力,但针对源代码任务的分布偏移分析与基准测试进展有限。为填补此空白,本文首创性地提出CodeS,一个用于源代码学习的分布偏移基准数据集。具体而言,CodeS支持两种编程语言(Java和Python)与五种偏移类型(任务、程序员、时间戳、词元与具体语法树)。基于CodeS的大量实验揭示:1)其他领域(如计算机视觉)的的分布外检测器不能泛化至源代码;2)所有代码分类模型均受分布偏移影响;3)基于表示的偏移比其他偏移对模型影响更大;4)预训练双模态模型对分布偏移相对更具抵抗力。
引用
@article{arxiv.2206.05480,
title = {CodeS: Towards Code Model Generalization Under Distribution Shift},
author = {Qiang Hu and Yuejun Guo and Xiaofei Xie and Maxime Cordy and Lei Ma and Mike Papadakis and Yves Le Traon},
journal= {arXiv preprint arXiv:2206.05480},
year = {2023}
}
备注
accepted by ICSE'23-NIER