SLiMFast:数据融合与源可靠性的保证结果
数据库
2016-11-15 v3
摘要
我们关注数据融合,即通过估计数据源准确性将来自数据源的冲突数据统一为单一表示的问题。我们提出SLiMFast,一个将数据融合表述为判别概率模型上的统计学习问题的框架,其在许多情况下对应于逻辑回归。与使用复杂生成模型的先前方法相反,判别模型对数据源做出较少的分布假设,并使我们能够获得严格的理论保证。此外,我们展示了SLiMFast如何能够将领域知识融入数据融合,从而相较最先进的基线实现高达50%的准确性提升。基于我们的理论结果,我们设计了一个优化器,使用户无需手动选择用于学习SLiMFast参数的算法。我们在多个真实世界数据集上验证了该优化器,并表明其能准确预测产生最佳数据融合结果的学习算法。
引用
@article{arxiv.1512.06474,
title = {SLiMFast: Guaranteed Results for Data Fusion and Source Reliability},
author = {Manas Joglekar and Theodoros Rekatsinas and Hector Garcia-Molina and Aditya Parameswaran and Christopher Ré},
journal= {arXiv preprint arXiv:1512.06474},
year = {2016}
}