加权 Jaccard 相似度下的近似重复文本对齐
数据库
2025-09-03 v1
摘要
近似重复文本对齐是指在语料库的所有文本中,识别出与给定查询相似的所有子序列(子串)的任务。传统方法依赖种子-扩展-过滤启发式策略,缺乏准确性保证且需要许多难以调整的参数。近期方法在基于哈希的框架下利用 min-hash 技术:根据子序列的 min-hash 对其进行分组,并对任意查询,找到与查询草图相似的所有草图。这些方法保证能报告出所有与查询的估计无权重 Jaccard 相似度超过用户给定阈值的子序列,且效率较高。然而,它们未能考虑词元重要性或频率,这限制了其在词元带有权重(如 TF-IDF)的实际场景中的应用。为了解决这一问题,我们提出了 MONO,一种使用一致加权采样来支持加权 Jaccard 相似度的方法。MONO 在基于哈希的框架内达到了最优性。例如,当词元权重与频率成正比时,对于长度为 n 的文本,MONO 预期生成 O(n + n log f) 个组,其中 f 是最大词元频率。每个组占用 O(1) 空间,并代表几个共享相同采样的子序列。我们证明该界限是紧的:在最坏情况下,任何算法预期都必须产生 Omega(n + n log f) 个组。实验表明,MONO 在索引构建时间上比现有最优方法快达 26 倍,索引大小减小达 30%,查询延迟改善达 3 倍,且具有良好的可扩展性。
引用
@article{arxiv.2509.00627,
title = {Near-Duplicate Text Alignment under Weighted Jaccard Similarity},
author = {Yuheng Zhang and Miao Qiao and Zhencan Peng and Dong Deng},
journal= {arXiv preprint arXiv:2509.00627},
year = {2025}
}