中文

K-Means、Ward 和 DBSCAN 的重复性研究

机器学习 2025-12-24 v1 人工智能

摘要

可重复性在机器学习中至关重要,因为它确保模型或实验产生相同的科学结论。对于特定算法,若以位级相同结果实现可重复性,也是科学完整性的关键,因为这有助于调试。我们将几个非常流行的聚类算法:K-Means、DBSCAN 和 Ward 分解为其基本步骤,并识别实现每一阶段可重复性所需的条件。我们使用 Python 库 scikit-learn 的实现示例来检查每种方法的可重复性方面。我们的结果揭示了在 OpenMP 线程数超过两个时,K-Means 结果不一致。本工作旨在提高此问题在用户和开发者之间的意识,鼓励进一步调查和潜在修复。

关键词

引用

@article{arxiv.2512.19772,
  title  = {A K-Means, Ward and DBSCAN repeatability study},
  author = {Anthony Bertrand and Engelbert Mephu Nguifo and Violaine Antoine and David Hill},
  journal= {arXiv preprint arXiv:2512.19772},
  year   = {2025}
}