这是谁写的?识别豪萨语中机器生成与人类生成的文本
计算与语言
2025-03-18 v1
摘要
大型语言模型(LLMs)的进步使其能够熟练完成包括内容生成在内的各种任务。然而,不受监管的使用可能会导致剽窃以及生成和传播假新闻等恶意活动,尤其是在低资源语言中。大多数现有的机器生成文本检测器都是在英语、法语等高资源语言上训练的。在本研究中,我们开发了首个能够区分豪萨语中人类生成内容和机器生成内容的大规模检测器。我们抓取了七个豪萨语媒体渠道的人类生成文本,并使用 Gemini-2.0 flash 模型根据人类生成文章的标题自动生成相应的豪萨语文章。我们在生成的数据集上微调了四个预训练的以非洲为中心的模型(AfriTeVa、AfriBERTa、AfroXLMR 和 AfroXLMR-76L),并使用准确率和 F1 分数指标评估了它们的性能。AfroXLMR 取得了最高的性能,准确率为 99.23%,F1 分数为 99.21%,证明了其在豪萨语文本检测中的有效性。我们的数据集已公开发布,以促进进一步的研究。
引用
@article{arxiv.2503.13101,
title = {Who Wrote This? Identifying Machine vs Human-Generated Text in Hausa},
author = {Babangida Sani and Aakansha Soy and Sukairaj Hafiz Imam and Ahmad Mustapha and Lukman Jibril Aliyu and Idris Abdulmumin and Ibrahim Said Ahmad and Shamsuddeen Hassan Muhammad},
journal= {arXiv preprint arXiv:2503.13101},
year = {2025}
}