中文

带集合离群点的聚类及其在关系聚类中的应用

数据结构与算法 2025-12-23 v2 数据库

摘要

我们引入并研究了带集合离群点的 kk-中心聚类问题,这是经典的带离群点 kk-中心聚类的一种自然且实用的推广。我们的模型允许从给定的候选离群点集族 H\mathcal{H} 中丢弃最多 zz 个子集,而不是移除单个数据点。给定度量空间 (P,dist)(P,\mathsf{dist}),其中 PP 是元素集合,dist\mathsf{dist} 是距离度量,H2P\mathcal{H}\subseteq 2^P 是一个集族,以及参数 k,zk, z,目标是计算一组 kk 个中心 SPS\subseteq P 和一个包含 zz 个集合的集族 HHH\subseteq \mathcal{H},以最小化 maxpP(hHh)minsSdist(p,s)\max_{p\in P\setminus(\bigcup_{h\in H} h)} \min_{s\in S}\mathsf{dist}(p,s)。这种抽象捕捉了数据库应用中常见的结构化噪声,例如数据集成和传感器系统中的故障数据源或损坏记录。我们针对一般和几何设定下的该问题提出了首个近似算法。我们的方法提供三准则近似:选择最多 2k2k 个中心和 2fz2f z 个离群点集(其中 ff 是一个点所属集合的最大数量),同时在聚类代价上实现 O(1)O(1)-近似。在几何设定下,我们利用 range 树和 BBD 树实现了近线性时间算法。在许多实际应用中 f=1f=1。在这种情况下,我们通过构建小型 \emph{coresets} 进一步改进了算法的运行时间。我们还为一般问题提供了硬度结果,表明在选择少于 fzf\cdot z 个离群点集时,不太可能对聚类代价获得任何次线性近似。我们证明该模型自然地捕捉了带离群点的关系聚类:离群点是移除后会影响连接输出的输入元组。我们为两者都提供了近似算法,建立了鲁棒聚类与关系查询评估之间的紧密联系。

关键词

引用

@article{arxiv.2509.16194,
  title  = {Clustering with Set Outliers and Applications in Relational Clustering},
  author = {Vaishali Surianarayanan and Neeraj Kumar and Stavros Sintos},
  journal= {arXiv preprint arXiv:2509.16194},
  year   = {2025}
}