中文

面向真实合成用户生成内容:生成在线讨论的脚手架方法

计算与语言 2024-08-19 v1 信息检索 机器学习

摘要

合成数据的出现代表了现代机器学习的一次关键转变,为满足在真实数据稀缺、高度私密或难以获取的领域中对大量数据的需求提供了解决方案。我们研究了创建真实、大规模的合成用户生成内容数据集的可行性,指出此类内容日益普遍,并且是频繁被寻求的信息来源。大型语言模型(LLM)为生成合成社交媒体讨论线程提供了一个起点,因为它们能够产生代表在线交互的多样化回复。然而,正如我们所证明的,LLM 的直接应用在捕捉在线讨论的复杂结构方面收效甚微,而标准的提示机制缺乏足够的控制力。因此,我们提出了一种多步生成过程,其前提是创建讨论线程的紧凑表示,称为脚手架(scaffolds)。我们的框架是通用的,但可以适应特定社交媒体平台的独特特征。我们使用来自两个不同在线讨论平台的数据证明了其可行性。为了应对确保合成数据代表性和真实性的基本挑战,我们提出了一套评估措施来比较我们框架的各种实例化。

关键词

引用

@article{arxiv.2408.08379,
  title  = {Towards Realistic Synthetic User-Generated Content: A Scaffolding Approach to Generating Online Discussions},
  author = {Krisztian Balog and John Palowitch and Barbara Ikica and Filip Radlinski and Hamidreza Alvari and Mehdi Manshadi},
  journal= {arXiv preprint arXiv:2408.08379},
  year   = {2024}
}