中文

探索 ChatGPT 复现人类标签在社交计算任务中的能力(扩充版)

人工智能 2024-07-10 v1 计算与语言

摘要

利用大型语言模型(LLM)如 ChatGPT 的潜力,可通过包容、伦理和可持续的方式来解决社会挑战。本文我们考察 ChatGPT 在社交计算任务中标注数据能力的范围,旨在减少开展网页研究的复杂性和成本。为评估 ChatGPT 的潜力,我们使用 ChatGPT 对七个数据集进行重新标注,涵盖新冠疫情虚假信息、社交机器人欺骗、网络�凌、点击诱导新闻以及俄乌战争等紧迫社会议题。我们的发现表明,ChatGPT 在处理这些数据标注任务方面展现出前景,尽管存在一些挑战。在七个数据集中,ChatGPT 实现了平均为 72.00% 的注释 F1 分数。其在点击诱导新闻标注方面表现突出,正确标签率达到 89.66%。然而,我们也观察到单个标签性能之间存在显著差异。我们的研究揭示了 ChatGPT 标注性能的可预测模式。因此,我们提出了 GPT-Rater,一个用于预测给定标注任务中 ChatGPT 是否能正确标注数据的工具。研究人员可使用该工具识别 ChatGPT 在其标注需求方可能合适的场景。我们展示了 GPT-Rater 能够有效预测 ChatGPT 的性能。它在点击标题数据集上表现最佳,实现平均 F1 分数为 95.00%。我们认为,这项研究为新的分析方法开辟了道路,并有助于降低参与社交计算研究的门槛。

关键词

引用

@article{arxiv.2407.06422,
  title  = {Exploring the Capability of ChatGPT to Reproduce Human Labels for Social Computing Tasks (Extended Version)},
  author = {Yiming Zhu and Peixian Zhang and Ehsan-Ul Haq and Pan Hui and Gareth Tyson},
  journal= {arXiv preprint arXiv:2407.06422},
  year   = {2024}
}

备注

Extended version of accepted short paper to ASONAM 2024. arXiv admin note: text overlap with arXiv:2304.10145