中文

评估检测AI生成科研文本的经典机器学习与Transformer方法

计算与语言 2025-09-26 v1 人工智能

摘要

大型语言模型(LLM)如ChatGPT的快速采用模糊了人类文本与AI生成文本之间的界限,引发关于学术诚信、知识产权以及虚假信息传播的紧迫问题。因此,对于公平评估以保障人类真实性并培育数字通信信任,迫切需要可靠的AI文本检测。本研究探索了当前机器学习(ML)方法在区分ChatGPT-3.5生成文本与人类撰写文本方面的效果,采用了来自广泛科研主题的250对摘要的标记数据集。我们测试并比较了经典(搭载经典词袋、词性标注和TF-IDF特征的Logistic回归)与Transformer-based(BERT集成N-gram、DistilBERT、带轻量自定义分类器的BERT、基于LSTM的N-gram模型)ML检测技术。为评估每个模型在检测AI生成科研文本方面的性能,我们也旨在测试这些模型的集成是否能超越单一检测器。结果表明,DistilBERT实现了最佳整体性能,Logistic回归和BERT-Custom提供了稳健且均衡的替代方案;LSTM和BERT-N-gram方法表现较差。最大投票集成三个最佳模型未能超越DistilBERT本身,凸显了单一基于Transformer的表示相较于单纯模型多样性的首要性。通过全面评估这些AI文本检测方法的优势与弱点,本工作为构建更稳健的Transformer框架奠定了基础,旨在与不断提升的生成式AI模型保持一致。

关键词

引用

@article{arxiv.2509.20375,
  title  = {Assessing Classical Machine Learning and Transformer-based Approaches for Detecting AI-Generated Research Text},
  author = {Sharanya Parimanoharan and Ruwan D. Nawarathna},
  journal= {arXiv preprint arXiv:2509.20375},
  year   = {2025}
}