用于去重任务的半监督聚类
机器学习
2020-05-27 v1 机器学习
摘要
数据去重是在数据库中检测对应于同一真实世界实体的多条记录的任务。在这项工作中,我们将去重视为一个聚类问题,其目标是将对应于同一物理实体的记录放入同一簇中,并将对应于不同物理实体的记录放入不同簇中。我们引入了一个称为承诺相关聚类的框架。给定一个带标签为和的边的完全图,目标是找到使簇内边数与簇间边数(或相关损失)之和最小的聚类。最优聚类也可视为一个完全图,其中对应于同一簇中点的边标记为,其他边标记为。在与之间边差异“较小”的承诺下,我们证明寻找最优聚类(或)仍是NP难的。[Ashtiani et. al, 2016]引入了半监督聚类的框架,其中学习算法可访问一个预言机,该预言机回答两个点是否属于同一或不同簇。我们进一步证明,即使可访问同簇预言机,只要对预言机的查询次数不太大(,其中为顶点数),该承诺版本仍是NP难的。鉴于这些负面结果,我们考虑相关聚类的一个受限版本。如前所述,目标是找到使相关损失最小的聚类。然而,我们将自身限制于给定的聚类类。我们提供了一种半监督算法方法来解决该受限变体,并带有成功保证。
引用
@article{arxiv.1810.04361,
title = {Semi-supervised clustering for de-duplication},
author = {Shrinu Kushagra and Shai Ben-David and Ihab Ilyas},
journal= {arXiv preprint arXiv:1810.04361},
year = {2020}
}