中文

阿拉伯语AI指纹:大语言模型文本的文体学分析与检测

计算与语言 2025-06-05 v2 人工智能

摘要

大语言模型(LLM)在生成类人文本方面具备了前所未有的能力,对教育、社交媒体和学术界等关键领域的信息完整性构成了隐蔽而重大的挑战,使得复杂的虚假信息活动成为可能,损害医疗指导的可信度,并助长有针对性的宣传。这一挑战在阿拉伯语等研究尚少且资源匮乏的语言中尤为严峻。本文对阿拉伯语机器生成文本进行了全面调查,考察了学术和社交媒体领域中多种生成策略(仅从标题生成、内容感知生成和文本精修)以及多种模型架构(ALLaM、Jais、Llama 和 GPT-4)。我们的文体学分析揭示了在这些不同语境下区分人类撰写与机器生成阿拉伯语文本的独特语言模式。尽管 LLM 生成的文本具有类人特征,但我们证明其在阿拉伯语输出中会产生可检测的签名,且这些签名具有在不同语境间显著变化的领域特定特征。基于这些见解,我们开发了基于 BERT 的检测模型,在正式语境中取得了卓越的性能(F1分数高达 99.9%),并在不同模型架构间保持了很高的精确度。我们的跨领域分析证实了先前文献中报道的泛化挑战。据我们所知,这项工作是对阿拉伯语机器生成文本迄今为止最全面的调查,独特地结合了多种提示生成方法、多样的模型架构以及跨多种文本领域的深入文体学分析,为开发稳健的、基于语言学的检测系统奠定了基础,这对于维护阿拉伯语语境下的信息完整性至关重要。

关键词

引用

@article{arxiv.2505.23276,
  title  = {The Arabic AI Fingerprint: Stylometric Analysis and Detection of Large Language Models Text},
  author = {Maged S. Al-Shaibani and Moataz Ahmed},
  journal= {arXiv preprint arXiv:2505.23276},
  year   = {2025}
}