AdaBox:基于参数泛化的自适应密度箱聚类
机器学习
2026-03-17 v1 人工智能
摘要
密度聚类算法如 DBSCAN 和 HDBSCAN 是发现任意形状聚类的基础工具,但其实际效用受到严重的超参数敏感性限制——在一个数据集上调优的参数经常无法 transfers 到其他数据集,导致每次部署都需要昂贵的重新优化。我们引入 AdaBox(自适应密度箱聚类),一个 designed for 跨不同数据几何形状鲁棒性的网格基密度聚类算法。AdaBox 具有六参数设计,其中参数捕获聚类结构而非成对点关系。四个参数天然具有尺度不变性,一个自我纠正抽样偏差,一个通过密度缩放阶段调整,使其在 30-200 倍尺度因子上实现可靠的参数 transfer。AdaBox 通过五个阶段处理数据:自适应网格构建、宽松种子初始化、迭代生长伴随毕业、统计聚类合并和高斯边界细化。广泛评估在 111 个数据集上显示三个关键发现:(1)AdaBox 在五个评估指标上显著优于 DBSCAN 和 HDBSCAN,在 78%的数据集上取得最佳得分,p<0.05;(2)AdaBox 独具参数泛化性。方案 A(直接 transfer 到 30-100 倍更大数据集)显示 AdaBox 在保持性能的同时,基线方法崩溃。(3)消融研究确认所有五个架构阶段对于维持鲁棒性至关重要。
引用
@article{arxiv.2603.13339,
title = {AdaBox: Adaptive Density-Based Box Clustering with Parameter Generalization},
author = {Ahmed Elmahdi},
journal= {arXiv preprint arXiv:2603.13339},
year = {2026}
}