中文

距离分布在聚类分析中的利用

机器学习 2021-08-24 v1

摘要

尽管距离度量被用于许多机器学习算法中,但关于独立于上下文的距离度量选择与评估的文献在需要使用先验知识的意义上较为有限。在聚类分析中,当前研究在应用基于误差概率的无监督方法后评估距离度量的选择,隐含地将目标设定为重现数据中预定义的划分。此类研究使用的聚类通常基于数据上下文以及特定研究的自定义目标。根据数据上下文的不同,距离分布的不同性质被认为与适当的距离选择相关。然而,如果聚类分析基于寻找数据相似划分的任务,那么划分内距离应小于划分间距离。通过镜像密度图对这一目标进行系统性的分布分析研究表明,多模态距离分布在聚类分析中更可取。因此,在无监督方法的评估阶段之前,用高斯混合对距离分布进行建模是有利的。实验在多个用于聚类任务的人工数据集和自然数据集上进行。

关键词

引用

@article{arxiv.2108.09649,
  title  = {The Exploitation of Distance Distributions for Clustering},
  author = {Michael C. Thrun},
  journal= {arXiv preprint arXiv:2108.09649},
  year   = {2021}
}

备注

19 pages, 6 figures