中文

AINL-Eval 2025 共享任务:俄语 AI 生成科学摘要的检测

计算与语言 2025-08-14 v1

摘要

大语言模型(LLMs)的快速发展彻底改变了文本生成,使得区分人类撰写和 AI 生成的内容变得越来越困难。这对学术诚信构成了重大挑战,尤其是在科学出版和检测资源通常有限的多语言环境中。为了解决这一关键差距,我们推出了 AINL-Eval 2025 共享任务,专门聚焦于俄语 AI 生成科学摘要的检测。我们提出了一个新颖的大规模数据集,包含 52,305 个样本,涵盖 12 个不同科学领域的人类撰写摘要以及来自五个最先进大语言模型(GPT-4-Turbo、Gemma2-27B、Llama3.3-70B、Deepseek-V3 和 GigaChat-Lite)的 AI 生成对应摘要。该任务的一个核心目标是挑战参与者开发能够泛化到(i)先前未见过的科学领域和(ii)训练数据中未包含的模型的鲁棒解决方案。该任务分两个阶段组织,吸引了 10 支队伍和 159 份提交,顶级系统在识别 AI 生成内容方面表现出色。我们还建立了一个持续的共享任务平台,以促进这一重要领域的持续研究和长期进步。数据集和平台可在 https://github.com/iis-research-team/AINL-Eval-2025 公开获取。

关键词

引用

@article{arxiv.2508.09622,
  title  = {AINL-Eval 2025 Shared Task: Detection of AI-Generated Scientific Abstracts in Russian},
  author = {Tatiana Batura and Elena Bruches and Milana Shvenk and Valentin Malykh},
  journal= {arXiv preprint arXiv:2508.09622},
  year   = {2025}
}

备注

AINL 2025 Conference