中文

材料背景下高维无监督聚类任务中各向同性量化指标

机器学习 2023-05-29 v1 人工智能 化学物理

摘要

聚类是机器学习中的常见任务,但无标签数据的聚类难以量化。聚类算法在化学中的应用常依赖于材料表示。由于这些数据的高维特性,确定不同表示、聚类算法或数据变换对所得聚类的影响十分困难。我们针对聚类的各向同性度量进行了详尽分析,包括基于已有推导的一种新颖实现。利用医学成像中用于比较的常用方法——分数各向异性(fractional anisotropy),我们将这些度量扩展以考察一组聚类的平均各向同性。通过量化核近似函数对无机晶体结构数据库(Inorganic Crystal Structure Database)不同表示的影响,展示了此类度量的一个用例。在分析 MNIST 数据集的学习嵌入中展示了这些方法的更广泛适用性。我们探究了随机聚类,以检视所提各向同性度量间的差异,并观察各方法如何随维度缩放。我们提供了这些度量的 Python 实现供社区使用。

关键词

引用

@article{arxiv.2305.16372,
  title  = {Metrics for quantifying isotropy in high dimensional unsupervised clustering tasks in a materials context},
  author = {Samantha Durdy and Michael W. Gaultois and Vladimir Gusev and Danushka Bollegala and Matthew J. Rosseinsky},
  journal= {arXiv preprint arXiv:2305.16372},
  year   = {2023}
}

备注

31 pages, 6 figures