中文

AI Generated Text Detection

计算与语言 2026-01-08 v1 人工智能

摘要

大型语言模型的快速发展导致 AI 生成文本的增加,学生们越来越多地将 LLM 生成的内容用作自己的作品,这违反了学术诚信。本文 presents 对 AI 文本检测方法的评估,包括传统机器学习模型和基于 transformer 的架构。我们利用 HC3 和 DAIGT v2 两个数据集构建统一的基准测试,并应用基于主题的数据划分以防止信息泄露。这种方法确保了在未见域上的稳健泛化。我们的实验显示,TF-IDF 逻辑回归实现了约82.87%的合理基线准确率。然而,深度学习模型表现更好。BiLSTM 分类器实现了88.86%的准确率,而 DistilBERT 以类似的88.11%准确率取得最高的 ROC-AUC 分数0.96,显示出最强的整体性能。结果表明,上下文语义建模显著优于词汇特征,凸显了通过合适的评估协议来缓解主题记忆的重要性。本工作的局限性主要涉及数据集多样性和计算资源限制。我们计划在未来工作中扩展数据集多样性,运用诸如 LoRA 之类的参数高效微调方法。我们还计划探索更小或蒸馏后的模型,采用更高效的批量处理策略和硬件感知优化。

关键词

引用

@article{arxiv.2601.03812,
  title  = {AI Generated Text Detection},
  author = {Adilkhan Alikhanov and Aidar Amangeldi and Diar Demeubay and Dilnaz Akhmetzhan and Nurbek Moldakhmetov and Omar Polat and Galymzhan Zharas},
  journal= {arXiv preprint arXiv:2601.03812},
  year   = {2026}
}