MultiSocial:社交媒体文本机器生成文本检测的多语言基准
计算与语言
2025-07-28 v2 人工智能
摘要
近期的大型语言模型能够生成高质量的多语言文本,人类难以将其与真实的人类撰写文本区分开来。然而,机器生成文本检测的研究主要集中在英语和较长文本上,例如新闻文章、科学论文或学生作文。社交媒体文本通常要短得多,并且经常包含非正式语言、语法错误或独特的语言元素(例如表情符号、话题标签)。现有方法在检测此类文本方面的能力存在研究空白,这也反映在缺乏现成的多语言基准数据集上。为填补这一空白,我们提出了首个用于社交媒体领域机器生成文本基准测试的多语言(22种语言)和多平台(5个社交媒体平台)数据集,名为MultiSocial。它包含472,097条文本,其中约58,000条为人类撰写,其余约等量文本由7个多语言LLM各自生成。我们利用该基准,以零样本和微调形式比较了现有的检测方法。我们的结果表明,微调后的检测器能够很好地处理社交媒体文本的训练,并且训练时平台的选择至关重要。
引用
@article{arxiv.2406.12549,
title = {MultiSocial: Multilingual Benchmark of Machine-Generated Text Detection of Social-Media Texts},
author = {Dominik Macko and Jakub Kopal and Robert Moro and Ivan Srba},
journal= {arXiv preprint arXiv:2406.12549},
year = {2025}
}
备注
ACL 2025 main