多边形数据集中高相似性簇的高效识别
机器学习
2025-09-30 v1 数据库
定量方法
摘要
虽然 Shapely 2.0 和 Triton 等工具的发展显著提升了空间相似性计算的效率,使其能够更快更可扩展地进行几何运算,但对于极大数据集,这些优化仍可能因计算需求的庞大而面临挑战。为此,我们提出一种框架,减少需验证的簇的数量,从而降低这些系统的计算负担。该框架集成了动态相似性指数阈值、受监督的调度以及召回率受约束的优化,高效识别具有最高空间相似性的簇,同时满足用户定义的精确率和召回率要求。通过利用核密度估计(KDE)动态确定相似性阈值,并利用机器学习模型优先排序簇,我们的方法在不牺牲准确性的前提下显著降低了计算成本。实验结果表明,该方法在可扩展性和有效性方面均表现出色,为大规模地理空间分析提供了实用解决方案。
引用
@article{arxiv.2509.23942,
title = {Efficient Identification of High Similarity Clusters in Polygon Datasets},
author = {John N. Daras},
journal= {arXiv preprint arXiv:2509.23942},
year = {2025}
}
备注
11 pages, 3 figures