中文

我们是否已经处于AI生成文本时代?对社交媒体上AIGT的量化与监控

计算机视觉与模式识别 2025-02-21 v1

摘要

社交媒体平台上AI生成文本(AI-Generated Text, AIGT)的出现日益增长。然而,AIGT的滥用可能对公共舆论产生深远影响,如传播虚假信息和操纵叙事。尽管如此,如何量化和监控社交媒体上的AIGT仍不明确。为填补这一空白,本文旨在量化和监控社交媒体上的AIGT。我们首先收集了一个约240万篇来自三个主要社交媒体平台(Medium、Quora和Reddit)的 数据集(SM-D)。随后,我们构建了一个多样化的数据集(AIGTBench),用于训练和评估AIGT检测器。AIGTBench组合了流行的开源数据集和我们从社交媒体文本中由12种大语言模型(LLMs)生成的AIGT数据,作为评估主流检测器的基准。在此基础上,我们识别出表现最佳的检测器(OSM-Det)。随后,我们将OSM-Det应用于SM-D,通过AI归因率(AI Attribution Rate, AAR)监控社交媒体平台上AIGT的分布情况,时间范围为2022年1月至2024年10月。具体而言,Medium和Quora的AAR分别从1.77%增长至37.03%和2.06%增长至38.95%,而Reddit的增长较慢,在相同时间段内从1.31%增至2.45%。我们进一步的分析表明,社交媒体上的AIGT在语言模式、主题分布、参与度水平和作者粉丝分布等方面与人类编写的文本存在显著差异。我们设想,本文在社交媒体AIGT分析方面的成果将为该领域的未来研究提供启示。

关键词

引用

@article{arxiv.2412.18147,
  title  = {Accelerating Post-Tornado Disaster Assessment Using Advanced Deep Learning Models},
  author = {Robinson Umeike and Thang Dao and Shane Crawford},
  journal= {arXiv preprint arXiv:2412.18147},
  year   = {2025}
}

备注

3 pages, 4 Figures, 1 Table