低资源语言 AI 生成文本检测:乌尔都语案例研究
计算与语言
2025-10-21 v1 人工智能
机器学习
摘要
大型语言模型(Large Language Models, LLMs)已能够生成与人类写作相近的文本,成为强大的内容创建工具,但这一不断提升的能力也使得区分人类编写与机器生成文本变得更加困难。对于乌尔都语等语言,这一挑战尤为严重,因为现有工具极其有限。为此,我们提出了一个专为乌尔都语语言设计的新型 AI 生成文本检测框架。开发了平衡数据集,包含 1800 篇人类撰写和 1800 篇 AI 生成文本,来源于 Gemini、GPT-4o-mini 和 Kimi AI 等模型。对特征进行详尽的语言和统计分析,包括字符数、词数、词汇丰富度(Type Token Ratio)以及 N-gram 模式,显著性通过 t 检验和 Mann-Whitney U 检验进行评估。在此数据集上微调了三种最先进的多语言变形器模型,包括 mdeberta-v3-base、distilbert-base-multilingualcased 和 xlm-roberta-base。mDeBERTa-v3-base 在测试集上取得最高性能,F1 分数达91.29,准确率为91.26%。该研究推动了乌尔都语社区中反驳虚假信息和学术不端行为的努力,同时为低资源语言的 NLP 工具开发做出了贡献。
引用
@article{arxiv.2510.16573,
title = {AI-Generated Text Detection in Low-Resource Languages: A Case Study on Urdu},
author = {Muhammad Ammar and Hadiya Murad Hadi and Usman Majeed Butt},
journal= {arXiv preprint arXiv:2510.16573},
year = {2025}
}