mcdok 在 SemEval-2026 Task 13:针对机器生成代码的大语言模型微调检测
机器学习
2026-04-24 v1 人工智能
计算与语言
软件工程
摘要
多语言环境下检测机器生成的代码片段是一项具有挑战性的任务。SemEval-2026 Task 13 从多个角度应对这一挑战,既作为二分类检测问题,也对来源进行归属识别。具体而言,其子任务还涵盖生成式LLM家族检测,以及人类与机器共同生成或被对抗性修改的代码,以隐瞒其来源。我们提交的系统通过探索各种更适用于代码理解的基础模型,调整了现有的mcdok方法(该方法聚焦于机器生成文本检测),以适应这些特定问题。结果表明,提交的系统在所有三个子任务中均表现具竞争力。然而,与顶尖系统相比,仍存在显著差距,进一步的改进仍有可能。
关键词
引用
@article{arxiv.2604.21365,
title = {mcdok at SemEval-2026 Task 13: Finetuning LLMs for Detection of Machine-Generated Code},
author = {Adam Skurla and Dominik Macko and Jakub Simko},
journal= {arXiv preprint arXiv:2604.21365},
year = {2026}
}