基于自适应L2 Wasserstein距离的分布值数据模糊聚类
机器学习
2016-05-03 v1
摘要
分布型(或分布值)数据是一种来自多种来源的新型数据,被视为分布变量的实现。本文提出一组用于由分布变量描述的数据的模糊c均值算法。这些算法使用分布之间的 Wasserstein 距离作为相异度度量。除了扩展模糊c均值算法以处理分布数据外,并考虑平方 Wasserstein 距离的分解,我们提出一组采用不同自动方式计算与变量及其分量相关联的权重的算法,全局或簇间。相关性权重在聚类过程中通过引入乘积为一(product-to-one)约束来计算。相关性权重导出自适应距离,表达每个变量或每个分量在聚类过程中的重要性,同时也作为聚类中的变量选择方法。我们在人工和真实世界数据上测试了所提算法。结果证实,相对于使用非自适应距离的标准模糊c均值,所提方法能更好地考虑数据的簇结构。
引用
@article{arxiv.1605.00513,
title = {Fuzzy clustering of distribution-valued data using adaptive L2 Wasserstein distances},
author = {Antonio Irpino and Francisco De Carvalho and Rosanna Verde},
journal= {arXiv preprint arXiv:1605.00513},
year = {2016}
}