中文

MUGC:机器生成与用户生成内容检测

计算与语言 2024-04-01 v1 人工智能 机器学习

摘要

随着深度神经网络(DNNs)和生成式AI等先进现代系统在生成令人信服且逼真内容方面的能力不断提升,区分用户生成内容和机器生成内容的需求日益凸显。在本研究中,我们对八种传统机器学习算法进行了比较评估,以在三个不同的数据集(诗歌、摘要和散文)上区分机器生成和人类生成的数据。我们的结果表明,传统方法在识别机器生成数据方面表现出很高的准确率,反映了 RoBERT 等流行预训练模型已记录的有效性。我们注意到,与人类生成的内容相比,机器生成的文本往往更短且词汇变化较少。虽然人类常用而当前 LLMs 忽略的特定领域相关关键词可能促成了这种高检测准确率,但我们表明,像 word2vec 这样更深层的词表示能够捕捉微妙的语义差异。此外,可读性、偏见、道德和情感比较揭示了机器生成和人类生成内容之间的明显对比。数据源(人类和机器生成)在表达风格和潜在偏见方面存在差异。本研究为各个领域机器生成内容不断增强的能力和相关挑战提供了有价值的见解。

关键词

引用

@article{arxiv.2403.19725,
  title  = {MUGC: Machine Generated versus User Generated Content Detection},
  author = {Yaqi Xie and Anjali Rawal and Yujing Cen and Dixuan Zhao and Sunil K Narang and Shanu Sushmita},
  journal= {arXiv preprint arXiv:2403.19725},
  year   = {2024}
}

备注

11 pages, 16 figures