基于风格比例特征的AI生成文本轻量级检测方法
计算与语言
2026-01-12 v2 人工智能
摘要
AI生成文本的数量不断增加,引发严重关切。大多数现有AI生成文本检测方法依赖在大型Transformer模型上微调或构建集成模型,计算成本高且在跨域泛化能力有限。现有轻量级替代方案在大规模数据集上达到的准确率显著低于。我们引入NEULIF,一种轻量级方法,在轻量级检测器类别中取得最佳性能,不需大量计算资源即可实现高检测准确率。在我们的方法中,文本首先被分解为风格比例和可读性特征,再用于CNN或随机森林(RF)分类。我们在Kaggle AI vs. Human语料库上进行评估与测试,CNN模型达97%准确率(~0.95 F1),RF模型达95%准确率(~0.94 F1),分别在ROC-AUC上达到99.5%和95%。CNN(~25MB)和随机森林(~10.6MB)模型比基于Transformer的集成模型小几个数量级,可在标准CPU设备上高效运行,且不牺牲准确率。这一研究还凸显了此类模型在更广泛的语言、领域和流式上下文中的潜在应用价值,表明在结构洞察指导下,简单性可与复杂性在AI生成内容检测中相抗衡。
引用
@article{arxiv.2511.21744,
title = {A Lightweight Approach to Detection of AI-Generated Texts Using Stylometric Features},
author = {Sergey K. Aityan and William Claster and Karthik Sai Emani and Sohni Rais and Thy Tran},
journal= {arXiv preprint arXiv:2511.21744},
year = {2026}
}
备注
19 pages, 6 figures, 3 tables