ConvNLP:基于图像的人工智能文本检测
机器学习
2024-07-11 v1 计算与语言
摘要
大型语言模型(LLM)等生成式AI技术的潜力受到伦理考量的制约,这些考量加剧了学术不端的问题。GPT-4 和 Llama 2 等LLM正变得越来越强大,能够生成复杂内容并解答问题,从撰写学术论文到解决复杂数学问题。学生们越来越依赖这些LLM来完成作业,从而损害学术诚信。现有AI文本检测工具计算密集且常缺乏泛化能力。本文提出一种新方法,通过词嵌入的可视化表示来检测LLM生成的AI文本。我们构建了一种新型卷积神经网络,称为ZigZag ResNet,并设计了一个提高泛化能力的调度器,命名为ZigZag Scheduler。通过在来自六种最先进LLM生成的文本数据集上进行广泛评估,我们的模型在域内和域间测试数据上的检测率显著,平均检测率达到88.35%。通过详尽的消融研究,我们的ZigZag ResNet和ZigZag Scheduler相较于基础ResNet可实现近4%的性能提升。模型的端到端推理延迟低于2.5ms/句。我们的解决方案提供了一种轻量、计算高效且快速的AI生成文本检测方法,具有更好的泛化性能,可帮助学术机构在学术环境中遏制LLM滥用的问题。通过本工作,我们致力于守护学术诚信的原则,确保在先进LLM时代学生工作的可信度。
引用
@article{arxiv.2407.07225,
title = {ConvNLP: Image-based AI Text Detection},
author = {Suriya Prakash Jambunathan and Ashwath Shankarnarayan and Parijat Dube},
journal= {arXiv preprint arXiv:2407.07225},
year = {2024}
}
备注
11 pages, 5 figures