C-OPH:利用循环置换提升单次置换哈希(OPH)的精度
机器学习
2021-11-19 v1 机器学习
摘要
Minwise 哈希(MinHash)是一种高效估计海量二值(0/1)数据中 Jaccard 相似度的经典方法。为标准 MinHash 理论为每个数据向量生成 个哈希值需要 个独立置换。有趣的是,近期“循环 MinHash”(C-MinHash)的工作表明仅需两个置换:第一个置换打破数据结构,第二个置换以循环方式复用 次。令人惊讶的是,C-MinHash 的估计精度被证明严格低于原始 MinHash。更近期的工作进一步表明实际上仅需一个置换。注意 C-MinHash 不同于 NIPS'12 发表的著名“单次置换哈希(OPH)”工作。OPH 及其采用不同“稠密化”方案的变体是标准 MinHash 的流行替代方案。稠密化步骤对于处理单次置换哈希中存在的空桶是必要的。本文中,我们提出融合 C-MinHash 的核心思想以提升单次置换哈希的精度。具体而言,我们为 OPH 开发了一种新的稠密化方法,相较现有所有 OPH 稠密化方案取得了最小估计方差。所提方法命名为 C-OPH(循环 OPH)。在初始置换(打破数据原有结构)后,C-OPH 仅需长度为 的“较短”置换(而非 ),其中 为原始数据维度、 为 OPH 中桶的总数;该短置换以循环移位方式在 个桶中复用。可证明 Jaccard 相似度的估计方差严格小于现有(稠密化)OPH 方法。
引用
@article{arxiv.2111.09544,
title = {C-OPH: Improving the Accuracy of One Permutation Hashing (OPH) with Circulant Permutations},
author = {Xiaoyun Li and Ping Li},
journal= {arXiv preprint arXiv:2111.09544},
year = {2021}
}