经典克隆检测器在AI时代是否依然胜任?
软件工程
2025-10-01 v1
摘要
AI生成代码的日益普及重塑了现代软件开发,为克隆代码引入了句法和语义上的变异。与传统的由人编写的克隆不同,AI生成的克隆展现出从大规模训练数据中学到的系统性句法模式和语义差异。这一转变为经典的代码克隆检测(CCD)工具带来了新的挑战,这些工具历来主要在人类编写的代码库上进行验证,并针对检测句法(类型1-3)和有限的语义克隆进行了优化。鉴于AI生成的代码既能产生句法克隆也能产生复杂的语义克隆,评估经典CCD工具在这一新范式下的有效性至关重要。在本文中,我们使用包含GPT-3生成克隆的基准测试集GPTCloneBench,系统地评估了九种广泛使用的CCD工具。为了将我们的结果置于背景中并加以验证,我们进一步在已建立的人类编写代码基准测试集BigCloneBench和SemanticCloneBench上测试了这些检测器,以衡量其在传统克隆与AI生成克隆之间性能的差异。我们的分析表明,经典的CCD工具,特别是那些通过有效规范化技术增强的工具,对AI生成的克隆仍保持着相当的有效性,但部分工具相比传统基准测试表现出显著的性能变化。本文的贡献在于:(1) 针对AI生成的克隆评估了经典CCD工具,提供了关于其当前优势与局限性的关键见解;(2) 强调了规范化技术在提高检测准确性方面的作用;(3) 提供了详细的可扩展性和执行时间分析,以支持实际的CCD工具选择。
引用
@article{arxiv.2509.25754,
title = {Are Classical Clone Detectors Good Enough For the AI Era?},
author = {Ajmain Inqiad Alam and Palash Roy and Farouq Al-omari and Chanchal Roy and Banani Roy and Kevin Schneider},
journal= {arXiv preprint arXiv:2509.25754},
year = {2025}
}