SMLT-MUGC:小型、中型与大型文本——机器生成内容与用户生成内容检测与比较
计算与语言
2024-07-19 v1 机器学习
摘要
大型语言模型(LLM)因其模仿人类语言的能力而受到广泛关注。识别LLM生成的文本对于理解其能力并缓解潜在影响至关重要。本文分析了文本长度不同的数据集:小型、中型和大型。我们比较了机器学习算法在四个数据集上的性能:(1)小型(选举、FIFA 和《权力的游戏》推文)、(2)中型(维基百科介绍和 PubMed 摘要)、(3)大型(OpenAI 网页文本数据集)。我们的结果表明,参数量极大的LLM(如GPT2的XL-1542变体,拥有15.42亿参数)使用传统机器学习方法难以检测(仅检测成功74%)。然而,参数量较小的LLM(7.62亿参数或更少)生成的文本检测准确率可达96%以上。我们检验了人类文本与机器生成文本在多个维度上的特征,包括语言学、性格、情感、偏见和道德。我们的发现表明,机器生成文本通常具有更高的可读性,能较好地模拟人类的道德判断,但在性格特征上存在差异。SVM和投票分类器(VC)模型在大多数数据集上始终表现出色,而决策树(DT)模型表现最差。当处理改写后的文本时,模型性能会下降,尤其是像推文这样的短文本。本研究凸显了检测LLM生成文本的挑战与重要性,并为改进检测方法和理解LLM细致能力提供了未来研究的方向。
引用
@article{arxiv.2407.12815,
title = {SMLT-MUGC: Small, Medium, and Large Texts -- Machine versus User-Generated Content Detection and Comparison},
author = {Anjali Rawal and Hui Wang and Youjia Zheng and Yu-Hsuan Lin and Shanu Sushmita},
journal= {arXiv preprint arXiv:2407.12815},
year = {2024}
}