MIK:面向生物序列可视化、分类与聚类的改进隔离核
机器学习
2024-10-22 v1 人机交互
机器学习
摘要
t-分布随机邻域嵌入(t-SNE)已成为用于可视化高维数据流行的降维技术。其默认计算数据点间成对相似性的方法采用 RBF 核和随机初始化(低维空间),成功捕获整体结构,但可能难以有效保持局部结构。该研究提出了一种新方法,称为改进隔离核(MIK),作为高斯核的替代方案,基于隔离核的概念。MIK 使用自适应密度估计更准确地捕获局部结构,并集成鲁棒性措施。它还对相邻点赋予更高的相似性值,对远距离点赋予更低的相似性值。使用正常高斯核、隔离核以及随机、PCA 和随机漫步初始化等多种初始化技术进行比较研究,以评估所提出的方法(MIK)。此外,我们比较了所有 种核与 种不同初始化方法的计算效率。我们的实验结果显示,所提出的核(MIK)和初始化方法选择具有若干优势。它在保持局部和全局结构方面表现更佳,能够在嵌入空间中更好地显示簇和亚簇。这些发现促进了降维技术的发展,并为研究人员和实践者提供了一种有效的数据探索、可视化和分析工具,适用于各个领域。
引用
@article{arxiv.2410.15688,
title = {MIK: Modified Isolation Kernel for Biological Sequence Visualization, Classification, and Clustering},
author = {Sarwan Ali and Prakash Chourasia and Haris Mansoor and Bipin koirala and Murray Patterson},
journal= {arXiv preprint arXiv:2410.15688},
year = {2024}
}