中文

大规模最小平方和聚类强下界

最优化与控制 2025-10-08 v2 机器学习

摘要

聚类是数据分析和机器学习中用于将相似数据点分组在一起的基本技术。在各种聚类方法中,最小平方和聚类(Minimum Sum-of-Squares Clustering, MSSC)是最广泛使用的方法之一。MSSC旨在最小化数据点与其相应聚类质心之间的总平方欧几里得距离。由于聚类的无监督性质,实现全局最优性至关重要,但又 Computationally 具有挑战。 finding the global solution 的复杂度随数据点的数量呈指数增长,使得精确方法对大规模数据集不实用。即使获得 MSSC 最优目标值的强下界也 Computationally 具有挑战,这使得很难评估启发式解的质量。我们通过引入一种用于验证启发式 MSSC 解的新方法来解决这一挑战,通过计算 optimality gaps。我们采用分治策略,将问题分解为可被精确求解的较小实例。该分解由一种辅助优化问题引导,即“反聚类问题”,我们为其设计了高效启发式方法。计算实验表明,该方法对于大规模实例非常有效,在大多数情况下实现低于3%的optimality gaps,同时保持合理的计算时间。这些结果凸显了该方法在评估大规模数据集的可行聚类解方面的实用性,弥补了 MSSC 评估中的关键差距。

关键词

引用

@article{arxiv.2502.08397,
  title  = {Strong bounds for large-scale Minimum Sum-of-Squares Clustering},
  author = {Anna Livia Croella and Veronica Piccialli and Antonio M. Sudoso},
  journal= {arXiv preprint arXiv:2502.08397},
  year   = {2025}
}