中文

InstaSynth:利用 ChatGPT 生成合成 Instagram 数据用于赞助内容检测的机遇与挑战

计算机与社会 2024-03-25 v1 计算与语言 社会与信息网络

摘要

大型语言模型(LLMs)引发了人们对降低生成可能用于不道德或非法目的(尤其是在社交媒体上)的文本成本的担忧。本文探究了此类模型在帮助执行与在线赞助内容披露相关的法律要求方面的前景。我们研究了利用 LLMs 生成合成 Instagram 标题的两个目标:第一个目标(保真度)是生成逼真的合成数据集。为此,我们实施了内容级和网络级指标来评估合成标题是否逼真。第二个目标(效用)是创建对赞助内容检测有用的合成数据。为此,我们评估了所生成的合成数据在训练分类器以识别 Instagram 上未披露广告方面的有效性。我们的研究表明,保真度和效用这两个目标可能相互冲突,而提示工程是一种有用但不充分的策略。此外,我们发现,虽然单个合成帖子可能看起来逼真,但整体上它们缺乏多样性、主题连通性和真实的用户交互模式。

关键词

引用

@article{arxiv.2403.15214,
  title  = {InstaSynth: Opportunities and Challenges in Generating Synthetic Instagram Data with ChatGPT for Sponsored Content Detection},
  author = {Thales Bertaglia and Lily Heisig and Rishabh Kaushal and Adriana Iamnitchi},
  journal= {arXiv preprint arXiv:2403.15214},
  year   = {2024}
}

备注

To appear at the 18th International AAAI Conference on Web and Social Media (ICWSM 2024) -- please cite accordingly