中文

人类 vs. 机器欺骗:使用集成学习区分 AI 生成和人类撰写的虚假新闻

计算与语言 2026-04-14 v1

摘要

大型语言模型的快速采用引入了一种新的 AI 生成虚假新闻类,与传统的人类撰写误information 共存,引发了关于这些两种形式的欺骗内容如何不同以及它们能可靠地被区分的重要问题。本研究检验了人类撰写和 AI 生成虚假新闻之间的语言、结构和情感差异,并评估了用于区分这些内容类型的机器学习和集成方法。构建了基于句子结构、词汇多样性、标点符号模式、可读性指数以及情感特征(捕捉恐惧、愤怒、快乐、悲伤、信任和期待等情感维度)的文档级别特征表示。应用多个分类模型,包括逻辑回归、随机森林、支持向量机、极端梯度提升和神经网络,并配合一个集成框架对模型进行聚合预测。评估模型性能指标包括准确率和受控器操作特征曲线下面积(AUC)。结果显示,分类性能强大且一致,唯有可读性基于特征成为最具信息量的预测器,AI 生成文本呈现更均匀的风格模式。集成学习在单个模型之上提供了有利但一致的改进。这些发现表明,文本的风格和结构属性为区分 AI 生成的误information 与人类撰写的虚假新闻提供了稳健的基础。

关键词

引用

@article{arxiv.2604.09960,
  title  = {Human vs. Machine Deception: Distinguishing AI-Generated and Human-Written Fake News Using Ensemble Learning},
  author = {Samuel Jaeger and Calvin Ibeneye and Aya Vera-Jimenez and Dhrubajyoti Ghosh},
  journal= {arXiv preprint arXiv:2604.09960},
  year   = {2026}
}