ALHD:阿拉伯语大规模多体裁 LLM 生成文本检测基准数据集
计算与语言
2025-10-23 v2 人工智能
机器学习
摘要
我们介绍ALHD,即首个专为区分人类与LLM生成文本而设计的大规模全面阿拉伯语数据集。ALHD覆盖三个体裁(新闻、社交媒体、评论),涵盖现代标准阿拉伯语(MSA)和方言阿拉伯语,包含超过40万平衡样本,由三家领先LLM生成,来源于多个人类来源,支持研究阿拉伯语LLM生成文本检测中的泛化能力。我们提供严格的预处理、丰富的标注和标准化的平衡划分,以支持可重复性。在此基础上,我们呈报、分析并讨论了本新数据集的基准实验,进而识别了研究空白并提出了未来研究方向。基准测试结果表明,微调BERT模型在准确率上与LLM模型相当,甚至优于LLM模型。然而,结果并非总是一致的,因为我们观察到在跨体裁情境下泛化存在挑战;确实,在处理跨体裁情境中未遇到的模式时,模型会感到困难,这种挑战在处理新闻文章时尤为突出,因为LLM生成的文本在风格上与人类文本相似,这为未来研究开辟了广阔的研究空间。ALHD为阿拉伯语LLM检测及其风险缓解研究(包括虚假信息、学术不端和网络威胁)奠定了基础。
引用
@article{arxiv.2510.03502,
title = {ALHD: A Large-Scale and Multigenre Benchmark Dataset for Arabic LLM-Generated Text Detection},
author = {Ali Khairallah and Arkaitz Zubiaga},
journal= {arXiv preprint arXiv:2510.03502},
year = {2025}
}
备注
47 pages, 15 figures. Dataset available at Zenodo: https://doi.org/10.5281/zenodo.17249602 Codebase available at GitHub: https://github.com/alikhairallah/ALHD-Benchmarking