中文

人类与 ChatGPT 在复杂社交媒体数据分类中的表现比较

计算与语言 2025-12-02 v1

摘要

生成式人工智能工具,如 ChatGPT,正在日益被用于计算社会科学家。尽管如此,仍有潜在空间需要改进对 ChatGPT 在复杂任务(如对包含含义细腻语言的数据集进行分类和标注)性能的理解。方法。本文我们测量 GPT-4 在此类任务上的性能,并将结果与人类标注员进行比较。我们检验 ChatGPT 3.5、4 和 4o 以审查大语言模型快速发展所带来的性能变化。我们构建四种 prompt 样式作为输入,并评估精确率、召回率和 F1 分数。定量和定性评估结果表明,虽然将标签定义包含在 prompt 中可能有助于性能,但总体而言 GPT-4 在分类含义细腻的语言方面存在困难。定性分析揭示了四项具体发现。我们的结果表明,应谨慎使用 ChatGPT 处理涉及含义细腻语言的分类任务。

关键词

引用

@article{arxiv.2512.00673,
  title  = {A Comparison of Human and ChatGPT Classification Performance on Complex Social Media Data},
  author = {Breanna E. Green and Ashley L. Shea and Pengfei Zhao and Drew B. Margolin},
  journal= {arXiv preprint arXiv:2512.00673},
  year   = {2025}
}

备注

About 15 pages, draft version of accepted conference full paper. Published paper to follow