用于虚假信息任务的合成动态数据集生成框架——SynDy
信息检索
2024-05-20 v1 人工智能
计算与语言
计算机与社会
摘要
离匿名社区受到虚假信息的不成比例冲击,常被主流事实核查工作所忽视,这加大了新兴事实核查组织规模化工作的需求。本文提出 SynDy 框架,用于合成动态数据集生成(Synthetic Dynamic Dataset Generation),以发挥最大化前沿大型语言模型(Large Language Models, LLMs)的能力,用于训练当地专业语言模型。到目前为止,SynDy 是首个利用 LLMs 为直接关乎虚假信息缓解的任务生成细粒度合成标签的论文,包括主张匹配(Claim Matching)、主题聚类(Topical Clustering)和主张关系分类(Claim Relationship Classification)。SynDy 利用 LLMs 和社交媒体查询,自动生成带有合成标签的、以主题为焦点的数据集,这些数据集为规模化人类主导的事实核查提供了必需工具,成本远低于人工标注数据。使用 SynDy 生成的标签进行训练,相较于标准基线方法表现提升,且与在人类标签上训练的模型性能不显著差异(后者可能难以获取)。SynDy 正在被集成到 Meedan 的聊天机器人提示线(tiplines)中,该系统已被超过 50 个组织使用,年服务用户超过 23 万人,并通过 WhatsApp 等消息应用自动分发人工编写的事实核查内容。SynDy 也将被集成到已部署的 Co-Insights 工具中,使低资源组织能够为其社区启动提示线。我们展望 SynDy 将进一步促进事实核查工具的开发,例如将新的虚假信息主张匹配到高质量解释器上,这些解释器针对常见的虚假信息主题。
引用
@article{arxiv.2405.10700,
title = {SynDy: Synthetic Dynamic Dataset Generation Framework for Misinformation Tasks},
author = {Michael Shliselberg and Ashkan Kazemi and Scott A. Hale and Shiri Dori-Hacohen},
journal= {arXiv preprint arXiv:2405.10700},
year = {2024}
}