无过度代表的聚类
数据结构与算法
2019-05-31 v1 机器学习
摘要
在本文中,我们考虑每个点都被赋予一种颜色的聚类问题。目标是聚类这些点以最小化经典聚类代价,但附加约束是任何簇中都不能有某种颜色被过度代表。该问题受实际聚类场景的启发,例如在聚类新闻文章时,文章的颜色即其来源, preferable 是任何单一新闻来源都不主导任何簇。对于该问题的最一般版本,我们获得了具有可证明性能保证的算法;我们的算法基于使用线性规划寻找分数解并随后对解进行舍入。对于问题中任何簇内没有任何颜色占绝对多数的特殊情况,我们获得了同样具有可证明保证的更简单的组合算法。在真实数据上的实验表明,我们的算法能有效地找到无过度代表的良好聚类。
引用
@article{arxiv.1905.12753,
title = {Clustering without Over-Representation},
author = {Sara Ahmadian and Alessandro Epasto and Ravi Kumar and Mohammad Mahdian},
journal= {arXiv preprint arXiv:1905.12753},
year = {2019}
}
备注
10 pages, 6 figures, in KDD 2019