带集合离群点的聚类及其在关系聚类中的应用
数据结构与算法
2025-12-23 v2 数据库
摘要
我们引入并研究了带集合离群点的 -中心聚类问题,这是经典的带离群点 -中心聚类的一种自然且实用的推广。我们的模型允许从给定的候选离群点集族 中丢弃最多 个子集,而不是移除单个数据点。给定度量空间 ,其中 是元素集合, 是距离度量, 是一个集族,以及参数 ,目标是计算一组 个中心 和一个包含 个集合的集族 ,以最小化 。这种抽象捕捉了数据库应用中常见的结构化噪声,例如数据集成和传感器系统中的故障数据源或损坏记录。我们针对一般和几何设定下的该问题提出了首个近似算法。我们的方法提供三准则近似:选择最多 个中心和 个离群点集(其中 是一个点所属集合的最大数量),同时在聚类代价上实现 -近似。在几何设定下,我们利用 range 树和 BBD 树实现了近线性时间算法。在许多实际应用中 。在这种情况下,我们通过构建小型 \emph{coresets} 进一步改进了算法的运行时间。我们还为一般问题提供了硬度结果,表明在选择少于 个离群点集时,不太可能对聚类代价获得任何次线性近似。我们证明该模型自然地捕捉了带离群点的关系聚类:离群点是移除后会影响连接输出的输入元组。我们为两者都提供了近似算法,建立了鲁棒聚类与关系查询评估之间的紧密联系。
引用
@article{arxiv.2509.16194,
title = {Clustering with Set Outliers and Applications in Relational Clustering},
author = {Vaishali Surianarayanan and Neeraj Kumar and Stavros Sintos},
journal= {arXiv preprint arXiv:2509.16194},
year = {2025}
}