中文

IberLEF 2023 的 AuTexTification 概述:多领域机器生成文本的检测与归因

计算与语言 2024-01-10 v1 人工智能 机器学习

摘要

本文介绍作为 IberLEF 2023 研讨会(伊比利亚语言评估论坛,在 SEPLN 2023 会议框架下)一部分的 AuTexTification 共享任务概述。AuTexTification 包含两个子任务:子任务 1 中,参与者须判定文本是由人类撰写还是由大语言模型(large language model, LLM)生成;子任务 2 中,参与者须将机器生成文本归因到六种不同文本生成模型之一。我们的 AuTexTification 2023 数据集包含超过 160,000 篇文本,涵盖两种语言(英语和西班牙语)和五个领域(推文、评论、新闻、法律和操作指南文章)。共有 114 支队伍报名参与,其中 36 支提交了 175 次运行,20 支提交了他们的工作说明。本概述中,我们介绍了 AuTexTification 数据集与任务、提交的参与系统以及结果。

关键词

引用

@article{arxiv.2309.11285,
  title  = {Overview of AuTexTification at IberLEF 2023: Detection and Attribution of Machine-Generated Text in Multiple Domains},
  author = {Areg Mikael Sarvazyan and José Ángel González and Marc Franco-Salvador and Francisco Rangel and Berta Chulvi and Paolo Rosso},
  journal= {arXiv preprint arXiv:2309.11285},
  year   = {2024}
}

备注

Accepted at SEPLN 2023