中文

LLM生成JavaScript的隐藏DNA:结构模式实现高精度作者归属识别

密码学与安全 2025-12-02 v2 机器学习

摘要

本文提出了首个大规模研究,探讨JavaScript代码由大语言模型 (LLM) 生成后是否能揭示具体是哪个模型生成,从而实现可靠的作者归属识别和模型指纹化。随着AI生成代码的快速崛起,归属识别正发挥关键作用,帮助检测漏洞、标记恶意内容并确保责任。虽然AI与人类检测通常将AI视为单一类别,但我们展示了单个LLM留下的独特风格迹象,甚至在同一模型家族或相同参数规模的模型之间也如此。为此,我们引入LLM-NodeJS数据集,包含来自20个大型语言模型的50,000个Node.js后端程序。每个程序有四个变体,总计250,000个独特JavaScript样本,以及两种额外表示形式(JSIR和AST),以满足多样化的研究需求。使用该数据集,我们对传统机器学习分类器和微调变换器编码器进行基准测试,并提出CodeT5-JSA——一种源自7.7亿参数CodeT5模型的自定义架构,移除其解码器并修改分类头。在五类、十类和二十类归属任务中分别实现了95.8%、94.6%和88.5%的准确率,超越BERT、CodeBERT和Longformer等其他测试模型。我们表明,分类器捕捉的是程序数据流和结构的深层风格规律,而非仅依赖表层特征。因此,即使在混淆、注释删除和大量代码变换后,归属识别仍然有效。为支持开放科学和可重复性,我们在GitHub上发布了LLM-NodeJS数据集、Google Colab训练脚本及所有相关材料:https://github.com/LLM-NodeJS-dataset。

关键词

引用

@article{arxiv.2510.10493,
  title  = {The Hidden DNA of LLM-Generated JavaScript: Structural Patterns Enable High-Accuracy Authorship Attribution},
  author = {Norbert Tihanyi and Bilel Cherif and Richard A. Dubniczky and Mohamed Amine Ferrag and Tamás Bisztray},
  journal= {arXiv preprint arXiv:2510.10493},
  year   = {2025}
}