中文

以毒攻毒:利用对抗性提示生成错误信息检测数据集

计算与语言 2024-01-10 v1 人工智能

摘要

大语言模型(如GPT、Bard、Llama等)在语言生成能力方面的近期成功,可能引发对其被滥用于通过生成假新闻和传播错误信息来煽动群众骚乱和群体仇恨的担忧。传统的开发错误信息真实数据集的方法因需要大量人工标注而难以扩展。在本文中,我们提出了一种基于大语言模型的方法,用于创建识别错误信息的银标准真实数据集。具体而言,给定一篇可信的新闻文章,我们提出的方法涉及提示大语言模型自动生成原始文章的摘要版本。我们方法中的提示充当控制机制,以在生成的摘要中生成特定类型的事实错误,例如不正确的数量、错误的归因等。为了研究该数据集的实用性,我们进行了一系列实验,训练了多种监督模型用于错误信息检测任务。

关键词

引用

@article{arxiv.2401.04481,
  title  = {Fighting Fire with Fire: Adversarial Prompting to Generate a Misinformation Detection Dataset},
  author = {Shrey Satapara and Parth Mehta and Debasis Ganguly and Sandip Modha},
  journal= {arXiv preprint arXiv:2401.04481},
  year   = {2024}
}