AdaCCD:基于自适应语义对比发现的跨语言代码克隆检测适配方法
软件工程
2024-03-07 v2 计算与语言
摘要
代码克隆检测旨在从大型代码库中检索功能相似的程序,近年来受到越来越多的关注。现代软件通常涉及多种编程语言。然而,由于标注数据不足以及模型自身设计限制,当前的代码克隆检测方法通常仅限于少数几种流行编程语言。为解决这些问题,我们提出 AdaCCD,一种新颖的跨语言适配方法,可在无需目标语言标注数据的情况下检测该语言中的克隆代码。AdaCCD 利用预训练编程语言模型提供的语言无关代码表示,并提出一种自适应精炼对比学习框架,将知识从资源丰富的语言迁移到资源匮乏的语言。我们通过构建一个包含 5 种编程语言的多语言代码克隆检测基准来评估 AdaCCD 的跨语言适配结果。AdaCCD 相比其他基线方法取得了显著提升,并达到了与有监督微调相当的性能。
引用
@article{arxiv.2311.07277,
title = {AdaCCD: Adaptive Semantic Contrasts Discovery Based Cross Lingual Adaptation for Code Clone Detection},
author = {Yangkai Du and Tengfei Ma and Lingfei Wu and Xuhong Zhang and Shouling Ji},
journal= {arXiv preprint arXiv:2311.07277},
year = {2024}
}