GenAI内容检测任务2:AI vs. 人类——学术作品真实性挑战
计算与语言
2024-12-25 v1 人工智能
摘要
本文概述了首次举办的学术作品真实性挑战的第一个版本,作为GenAI内容检测共享任务的一部分,在COLING 2025上举办。该挑战聚焦于检测机器生成的作品与人类撰写的作品的真实性。该任务定义如下:“给定一篇作品,识别它是由机器生成还是由人类撰写的。”该挑战涉及两种语言:英语和阿拉伯语。在评估阶段,25支团队为英语提交了系统,21支团队为阿拉伯语提交了系统,反映出对该任务的广泛兴趣。最终,七支团队提交了系统描述论文。大多数提交系统都使用微调的基于transformer的模型,其中一支团队使用了大型语言模型(LLM)如Llama 2和Llama 3。本文概述了任务表述、数据集构建过程以及评估框架。此外,我们总结了参赛团队所采用的方法。几乎所有的提交系统都超过了基于n-gram的基线,顶级系统在两种语言中都实现了0.98以上的F1分数,表明在机器生成文本检测方面取得了显著进展。
关键词
引用
@article{arxiv.2412.18274,
title = {GenAI Content Detection Task 2: AI vs. Human -- Academic Essay Authenticity Challenge},
author = {Shammur Absar Chowdhury and Hind Almerekhi and Mucahid Kutlu and Kaan Efe Keles and Fatema Ahmad and Tasnim Mohiuddin and George Mikros and Firoj Alam},
journal= {arXiv preprint arXiv:2412.18274},
year = {2024}
}
备注
AI Generated Content, Academic Essay, LLMs, Arabic, English