基于主动学习的视图驱动去重
数据库
2016-06-21 v1
摘要
诸如 Tableau 之类的可视化分析系统在交互式数据探索中日益普及。然而,这些工具目前无法协助用户检测或解决潜在的数据质量问题,包括众所周知的去重问题。近期的去重方法侧重于清洗整个数据集,通常需要数百至数千个用户标签。在本文中,我们探讨了可视化数据分析背景下的去重问题。我们提出了一种新的记录去重方法,旨在在有限的数据标注预算下尽可能生成最干净的视图。该方法背后的核心思想是考虑单个元组对可视化产生的影响,并监控清洗过程中视图的变化。通过对两个真实世界数据集的九种不同可视化进行实验,我们表明,在较小的标注预算下,我们的方法比 state-of-the-art 替代方案生成了显著更干净的视图,并且在请求更少标签后即停止了清洗过程。
引用
@article{arxiv.1606.05708,
title = {View-Driven Deduplication with Active Learning},
author = {Kristi Morton and Hannaneh Hajishirzi and Magdalena Balazinska and Dan Grossman},
journal= {arXiv preprint arXiv:1606.05708},
year = {2016}
}
备注
13 pgs