面向不同测量尺度的聚类——间隙比加权 K-means 算法
机器学习
2017-03-23 v1 数据结构与算法
机器学习
摘要
本文描述了一种对散布在广大区域且各维度具有不同测量尺度的数据进行聚类的方法。开发该算法是为了实现一种以无监督方式对物体进行分拣和存储的机器人应用。用于验证该应用的玩具数据集由不同形状和颜色的乐高积木组成。不受控的光照条件以及 RGB 颜色特征的使用,分别导致数据具有较大的离散度以及数据维度间存在不同的测量尺度。为克服数据中这两种特征的组合影响,我们开发了一种新的加权 K-means 算法,称为间隙比 K-means,它在运行 K-means 算法之前对特征空间的每个维度进行加权。与某一特征相关联的权重,正比于两个连续数据点之间的最大间隙与所有其他间隙平均值的比值。我们将该方法与另外两种 K-means 变体在乐高积木聚类问题以及另外两个常见分类数据集上进行了比较。
关键词
引用
@article{arxiv.1703.07625,
title = {Clustering for Different Scales of Measurement - the Gap-Ratio Weighted K-means Algorithm},
author = {Joris Guérin and Olivier Gibaru and Stéphane Thiery and Eric Nyiri},
journal= {arXiv preprint arXiv:1703.07625},
year = {2017}
}
备注
13 pages, 6 figures, 2 tables. This paper is under the review process for AIAP 2017