基于BERT深度学习算法的AI生成文本检测与分类
计算与语言
2024-10-15 v1 人工智能
机器学习
摘要
AI生成文本检测在各个领域发挥着越来越重要的作用。在本研究中,我们基于BERT算法开发了一个高效的AI生成文本检测模型,为解决相关问题提供了新的思路和方法。在数据预处理阶段,我们采取了一系列步骤来处理文本,包括转换为小写、分词、去除停用词、词干提取、去除数字和消除多余空格等操作,以确保数据质量和准确性。通过将数据集按60%和40%的比例划分为训练集和测试集,并观察训练过程中准确率和损失值的变化,我们发现模型在训练过程中表现良好。准确率从最初的94.78%稳步提升至99.72%,而损失值从0.261下降至0.021并逐渐收敛,这表明BERT模型能够高精度地检测AI生成的文本,且预测结果逐渐接近真实分类结果。对训练集和测试集结果的进一步分析显示,在损失值方面,训练集的平均损失为0.0565,而测试集的平均损失为0.0917,显示出略高的损失值。在准确率方面,训练集的平均准确率达到98.1%,而测试集的平均准确率为97.71%,两者相差不大,表明模型具有良好的泛化能力。总之,本研究提出的基于BERT算法的AI生成文本检测模型在实验中表现出高准确率和稳定性,为相关领域提供了有效的解决方案。
引用
@article{arxiv.2405.16422,
title = {AI-Generated Text Detection and Classification Based on BERT Deep Learning Algorithm},
author = {Hao Wang and Jianwei Li and Zhengyu Li},
journal= {arXiv preprint arXiv:2405.16422},
year = {2024}
}