基于离散化嵌套双igram检测LLM生成的Java代码
软件工程
2025-02-25 v1 人工智能
计算与语言
机器学习
摘要
大语言模型(LLM)广泛用于专业人士和学生的代码生成,这激励开发工具来检测LLM生成的代码,用于学术诚信和网络安全等应用。我们将这种作者归属问题作为二分类任务进行处理,同时进行特征识别和提取。我们提出了在源代码中各种大小的组上应用离散化嵌套双igram频率的新方法。与先前工作相比,通过将稀疏信息表示为密集成员箱,显著提升了性能。实验评估表明,我们的方法在检测GPT改写的Java代码片段方面,准确率显著优于常用的GPT代码检测API和基线特征,分别达到96%(相对于72%和79%)。我们也在40位作者的数据集上超越了三项先前的作品。在更大数据集上,我们的方法表现良好,使用GPT-4o实现99%的准确率和0.999的AUC,涵盖76,089个文件和超过1,000名作者,仅需227个特征。
引用
@article{arxiv.2502.15740,
title = {Detection of LLM-Generated Java Code Using Discretized Nested Bigrams},
author = {Timothy Paek and Chilukuri Mohan},
journal= {arXiv preprint arXiv:2502.15740},
year = {2025}
}
备注
This preprint precedes the final peer-reviewed version, which will be published in Springer's CSCI 2024 proceedings