以自动化检索语义相似文章辅助新闻真伪核查
信息检索
2021-03-30 v1 机器学习
摘要
虚假信息构成 21 世纪社会的主要威胁之一。由于每日发布的假新闻数量庞大,识别错误信息已成为一项关键挑战。然而,目前尚无应对假新闻编辑动态性与多样性的成熟方法。我们提出一种证据检索方法而非内容分类方法来处理假新闻。该学习任务被表述为一个无监督机器学习问题。为便于验证,我们向用户提供一组来自可靠新闻源、支持待查新闻文章假设的新闻文章,最终判断交由用户完成。技术上我们提出一个两步流程:(i) 聚合步:利用从给定文本中提取的信息,检索来自可靠新闻源的相似内容。(ii) 精炼步:通过度量文本与步骤(i)所得集合的语义距离,缩小支持证据范围。该距离基于 Word2Vec 与词移距离(Word Mover's Distance)计算。在我们的实验中,仅将低于特定距离阈值的内容视为支持证据。我们发现该方法对概念漂移具有不变性,即机器学习任务与文本中的假设无关。这使得在假新闻与传统新闻同样多样的当下,该方法具有高度适应性。我们的流程为未来进一步分析(如考察新闻报道中的偏见与差异)提供了可能。
引用
@article{arxiv.2103.15581,
title = {Supporting verification of news articles with automated search for semantically similar articles},
author = {Vishwani Gupta and Katharina Beckh and Sven Giesselbach and Dennis Wegener and Tim Wirtz},
journal= {arXiv preprint arXiv:2103.15581},
year = {2021}
}