中文

错误信息具有高困惑度

计算与语言 2020-06-11 v2 人工智能 机器学习

摘要

辟除错误信息是一项重要且时间紧迫的任务,因为若不及时遏制错误信息可能产生不利后果。然而,通常经由错误信息分类的辟谣监督方法需要人工标注数据,并不适合如COVID-19暴发等新兴事件的快速时间尺度。本文中,我们假定错误信息本身相比真实陈述具有更高困惑度,并提议利用困惑度以无监督方式辟除虚假声明。首先,我们根据与声明的句子相似度从科学与新闻源提取可靠证据。其次,我们用所提取证据对语言模型进行 priming( priming:以证据预激活模型),最后在辟谣时基于困惑度分数评估给定声明的正确性。我们构建了两个新的COVID-19相关测试集,一为科学内容,一为政治内容,并经验验证我们的系统优于现有系统。我们公开这些数据集以鼓励更多关于COVID-19及其他主题错误信息辟除的研究。

关键词

引用

@article{arxiv.2006.04666,
  title  = {Misinformation Has High Perplexity},
  author = {Nayeon Lee and Yejin Bang and Andrea Madotto and Pascale Fung},
  journal= {arXiv preprint arXiv:2006.04666},
  year   = {2020}
}