中文

事实核查中数据清洗的选择:最小化不确定性 vs. 最大化惊奇

数据库 2019-09-13 v1

摘要

我们研究在基于数值数据进行事实核查时,选择清洗哪些数值以核查声明这一优化问题。此类声明往往在技术上正确,但仍可能因两个原因产生误导。首先,数据可能包含不确定性与错误。其次,数据可能被“钓鱼”以推进特定立场。实践中,事实核查者无法负担清洗所有数据,必须选择清洗对核查声明“最重要”的部分。我们探讨了“最重要”的另类定义:一是确认声明性质(通过最小化这些度量的不确定性),另一则是反驳声明(通过最大化找到反论点的概率)。我们展示了这两个目标是否彼此一致,这对事实核查者何时应谨慎进行选择性数据清洗、以避免其反驳声明的意图所引入的潜在偏差具有重要启示。我们开发了求解该优化问题各变体的高效算法,相较朴素解法有显著改进。该问题尤其具有挑战性,因为事实核查背景下的目标是关于数据的复杂非线性函数。我们得到的结果可泛化至一大类函数,具有超出事实核查的潜在应用。

关键词

引用

@article{arxiv.1909.05380,
  title  = {Selecting Data to Clean for Fact Checking: Minimizing Uncertainty vs. Maximizing Surprise},
  author = {Stavros Sintos and Pankaj K. Agarwal and Jun Yang},
  journal= {arXiv preprint arXiv:1909.05380},
  year   = {2019}
}