中文

基于抽样的 Jaccard 包含度与相似度估计

统计计算 2025-07-22 v3 数据库 机器学习

摘要

本文解决了仅通过从每个集合中获取随机抽样即可估计两个集合之间的包含度和相似度的问题,无需依赖完整集合的抽样。该研究引入了二项分布模型,用于预测抽样之间的重叠情况,表明该方法在抽样规模远小于原集合规模时既准确又实用。本文将该模型与先前方法进行比较,展示在所考虑条件下其提供了更好的估计。还分析了该估计器的统计特性,包括误差界和实现特定准确度和置信水平所需的抽样规模。该框架扩展用于估计集合相似度,本文提供了在大规模数据系统中仅能获取部分或抽样数据时应用这些方法的指导。

关键词

引用

@article{arxiv.2507.10019,
  title  = {Sampling-Based Estimation of Jaccard Containment and Similarity},
  author = {Pranav Joshi},
  journal= {arXiv preprint arXiv:2507.10019},
  year   = {2025}
}