中文

面向研究的多平台社交媒体数据集生成

计算机与社会 2024-07-12 v1

摘要

社交媒体数据集对于研究虚假信息、影响操作、社交感知、仇恨言论检测、网络欺凌等重要话题至关重要。然而,这些数据集的获取往往受制于成本和平台监管,导致跨平台数据集的获取尤其具有挑战性。本文探讨了使用大型语言模型在多个社交媒体平台上生成与真实数据集在词汇和语义方面相匹配的数据集,以实现与真实数据集相当的质量。我们采用ChatGPT从两个真实数据集中生成合成数据,每个数据集包含来自三个不同社交媒体平台的帖子。我们评估了合成数据和真实数据的词汇和语义属性,并进行了比较。我们的实证发现表明,使用大型语言模型生成跨多平台社交媒体数据集是有前景的。然而,还需要进一步的改进来提高输出的保真度。

关键词

引用

@article{arxiv.2407.08323,
  title  = {Leveraging GPT for the Generation of Multi-Platform Social Media Datasets for Research},
  author = {Henry Tari and Danial Khan and Justus Rutten and Darian Othman and Rishabh Kaushal and Thales Bertaglia and Adriana Iamnitchi},
  journal= {arXiv preprint arXiv:2407.08323},
  year   = {2024}
}