利用大语言模型生成高保真合成多平台社交媒体数据集
计算与语言
2025-05-07 v1 计算机与社会
摘要
社交媒体数据集对于虚假信息、影响力操作、仇恨言论检测或网红营销实践等多种主题的研究至关重要。然而,由于成本和平台限制,对社交媒体数据集的访问常常受到制约。获取跨多个平台的数据集对于理解数字生态系统至关重要,但这尤其具有挑战性。本文探讨了大语言模型在创建跨多个平台的、词汇和语义上相关的社交媒体数据集方面的潜力,旨在匹配真实数据的质量。我们提出了基于多平台主题的提示方法,并采用各种语言模型,从两个真实数据集(每个数据集均由来自三个不同社交媒体平台的帖子组成)生成合成数据。我们评估了合成数据的词汇和语义属性,并将其与真实数据的属性进行比较。我们的实证发现表明,使用大语言模型生成合成多平台社交媒体数据是有前景的,不同的语言模型在保真度方面表现各异,并且可能需要后处理方法来生成用于研究的高保真合成数据集。除了对三种最先进的大语言模型进行实证评估外,我们的贡献还包括特定于多平台社交媒体数据集的新保真度指标。
引用
@article{arxiv.2505.02858,
title = {Towards High-Fidelity Synthetic Multi-platform Social Media Datasets via Large Language Models},
author = {Henry Tari and Nojus Sereiva and Rishabh Kaushal and Thales Bertaglia and Adriana Iamnitchi},
journal= {arXiv preprint arXiv:2505.02858},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2407.08323