一次性核心集:以 k-聚类为例
机器学习
2018-02-21 v3 机器学习
摘要
将聚类算法扩展到海量数据集是一项具有挑战性的任务。近年来,人们提出了若干基于数据摘要方法(如核心集与草图)的成功方法。尽管这些技术能提供可证明良好且精简的摘要,但它们本质上依赖于具体问题——实践者甚至在对数据进行探索之前,就必须确定一个固定的聚类目标。然而,能否同时针对广泛的聚类问题构建小型数据摘要?在本文中,我们通过提出一种高效算法对此问题给出肯定回答,该算法为 k-聚类问题构建此类一次性摘要,同时保持较强的理论保证。
引用
@article{arxiv.1711.09649,
title = {One-Shot Coresets: The Case of k-Clustering},
author = {Olivier Bachem and Mario Lucic and Silvio Lattanzi},
journal= {arXiv preprint arXiv:1711.09649},
year = {2018}
}
备注
To Appear In AISTATS 2018