中文

当哈希遇上楔形:一种寻找高相似度向量的分布式算法

社会与信息网络 2017-03-06 v1 分布式、并行与集群计算 数据结构与算法

摘要

寻找相似用户对是社交网络中的一项基本任务,在链接预测和关系强度检测等排名与个性化任务中有着众多应用。用户相似性的一种常见表现形式是基于网络结构的:每个用户由一个表示其网络连接的向量表示,其中这些向量之间的成对余弦相似度定义了用户相似性。用户相似性应用的主要任务是发现所有成对余弦相似度值大于给定阈值 τ\tau 的相似对。与先前假设 τ\tau 非常接近 1 的工作不同,我们关注 τ\tau 较小但仍有意义的推荐应用。所有对的余弦相似度问题在具有数十亿条边的网络上具有计算挑战性,对于 τ\tau 较小的设置更是如此。据我们所知,即使利用分布式算法的强大功能,对于在大型社交网络上计算所有用户对(例如 τ=0.2\tau = 0.2)也没有实际的解决方案。我们的工作通过引入一种新算法——WHIMP——直接应对这一挑战,该算法在 MapReduce 模型中高效地解决了这一问题。WHIMP 的关键见解是将 Cohen-Lewis 用于近似矩阵乘法的“楔形采样”方法与 Charikar 的 SimHash 随机投影技术相结合。我们提供了 WHIMP 的理论分析,证明其具有接近最优的通信成本,同时保持与现有技术相当的计算成本。我们还通过在四个海量数据集上计算所有高度相似对,实证证明了 WHIMP 的可扩展性,并表明它能准确找到高相似度对。特别地,我们注意到 WHIMP 成功处理了具有数百亿条边的整个 Twitter 网络。

关键词

引用

@article{arxiv.1703.01054,
  title  = {When Hashes Met Wedges: A Distributed Algorithm for Finding High Similarity Vectors},
  author = {Aneesh Sharma and C. Seshadhri and Ashish Goel},
  journal= {arXiv preprint arXiv:1703.01054},
  year   = {2017}
}