中文

微调预训练代码模型用于 AI 生成代码检测

计算与语言 2026-05-05 v1

摘要

本文描述了由团队 \textbf{Archaeology} 提交至 SemEval-2026 Task~13 的系统, 用于 AI 生成代码检测. 共享任务包含三个子任务; 我们参与 Subtask-A (二元分类: 人类编写代码 vs. AI 生成代码) 和 Subtask-B (11 类生成模型归因). 从 TF-IDF 和 Logistic 回归基线开始, 我们对四个预训练代码模型 (CodeBERT, GraphCodeBERT, UniXcoder, 和 CodeT5+) 进行微调, 为每个子任务采用独立策略. 对于 Subtask-A, 我们使用 leave-one-language-out 交叉验证, 代码增强, 分块推理与修剪均值聚合, 以及对困难数据集的阈值校准. 对于 Subtask-B, 我们使用 sandwich token packing, 类平衡损失, 以及多种子集成和测试时增强. 我们的最佳提交在 Subtask-A 上获得 0.737 的 macro-F1 分数 (位列 6/81 支队伍), 在 Subtask-B 上获得 0.422 的 macro-F1 分数 (位列 7/34 支队伍).

关键词

引用

@article{arxiv.2605.01596,
  title  = {Fine-Tuning Pre-Trained Code Models for AI-Generated Code Detection},
  author = {Jany-Gabriel Ispas and Sergiu Nisioi},
  journal= {arXiv preprint arXiv:2605.01596},
  year   = {2026}
}

备注

Archaeology at SemEval-2026 Task 13