中文

SQBC:利用 LLM 生成合成数据进行在线政治讨论立场检测的主动学习

计算与语言 2024-04-15 v1 人工智能 机器学习

摘要

立场检测是许多分析或支持在线政治讨论的应用的重要任务。常见方法包括微调基于 Transformer 的模型。然而,这些模型需要大量标注数据,而这些数据可能无法获取。在本工作中,我们提出了两种利用 LLM 生成的合成数据来训练并改进在线政治讨论立场检测智能体的不同方法:首先,我们展示了用合成数据增强小型微调数据集可以提升立场检测模型的性能。其次,我们提出了一种基于“Query-by-Comittee”方法的新型主动学习方法 SQBC。其核心思想是使用 LLM 生成的合成数据作为预言机,以识别最具信息量的未标注样本,从而将其选作人工标注对象。综合实验表明,这两种思路均能提升立场检测性能。有趣的是,我们观察到在主动挑选的样本上进行微调,其性能甚至可以超越使用完整数据集的表现。

关键词

引用

@article{arxiv.2404.08078,
  title  = {SQBC: Active Learning using LLM-Generated Synthetic Data for Stance Detection in Online Political Discussions},
  author = {Stefan Sylvius Wagner and Maike Behrendt and Marc Ziegele and Stefan Harmeling},
  journal= {arXiv preprint arXiv:2404.08078},
  year   = {2024}
}