一种用于谱聚类的新相似度函数及其在植物表型数据中的应用
机器学习
2025-05-26 v3 人工智能
摘要
将同一植物的不同物种聚类成不同组是开发该植物新品种的重要步骤。植物物种的表型(或物理)特征常用于进行聚类。层次聚类(HC)广泛用于此任务,但该算法准确率较低。在最近的一项工作(Shastri等人,2021)中,作者使用标准谱聚类(SC)算法来提高聚类准确率。他们在大豆物种上证明了其算法的有效性。在SC算法中,关键步骤之一是构建相似度矩阵。高斯相似度函数是构建该矩阵的标准选择。过去,许多工作提出了高斯相似度函数的变体以提高SC算法的性能,但都集中在方差或缩放上。过去的工作都没有研究过高斯相似度函数(自然指数函数)的底数"e"(欧拉数)的选择。基于谱图理论,特别是Cheeger不等式,在这项工作中我们提出使用底数为"a"的指数函数作为相似度函数。我们还将这种新方法与早期研究高斯相似度函数缩放的工作(Zelnik-Manor等人,2004)中的"局部缩放"概念相结合。通过特征值分析,我们从理论上证明我们提出的算法应该比现有算法更好。通过对2376个大豆物种和1865个水稻物种的评估,我们实验证明我们的新SC分别比标准SC好35%和11%。
关键词
引用
@article{arxiv.2312.14920,
title = {A New Similarity Function for Spectral Clustering with Application to Plant Phenotypic Data},
author = {Kapil Ahuja and Mithun Singh and Kuldeep Pathak and Milind B. Ratnaparkhe},
journal= {arXiv preprint arXiv:2312.14920},
year = {2025}
}
备注
6 Pages Double Column, 3 Figures, 4 Tables