关于排序邻域的复杂性
计算复杂性
2015-01-09 v1 数据结构与算法
摘要
记录链接关注识别数据库中语义等价的记录。为避免对 条记录进行全配对相似度比较的开销,采用分块方法。在一项开创性工作中,Hernandez 与 Stolfo 提出了排序邻域分块方法。近年来已提出若干经验变体。本文研究这些变体所基于的排序邻域过程的复杂性。我们表明,在排序邻域过程中达到最大性能需要解决一个子问题,该子问题通过从旅行商问题归约被证明是 NP 完全的。我们还表明该子问题可出现在传统分块方法中。最后,我们利用关于旅行商问题近似解的近期进展来定义并分析三种近似算法。
引用
@article{arxiv.1501.01696,
title = {On the Complexity of Sorted Neighborhood},
author = {Mayank Kejriwal and Daniel P. Miranker},
journal= {arXiv preprint arXiv:1501.01696},
year = {2015}
}