信息性初始化与核选择改进生物序列的 t-SNE
机器学习
2022-11-18 v1
摘要
t 分布随机邻域嵌入 (t-SNE) 是一种通过将每个点映射到低维 (LD) 空间(通常为二维)来解释高维 (HD) 数据的方法。它力求保留数据的结构。t-SNE 算法的一个重要组成部分是初始化过程,其从 LD 向量的随机初始化开始。然后使用该初始向量中的点,通过梯度下降迭代更新以最小化损失函数(KL 散度)。这使得相似的点相互吸引,同时将不相似的点推开。我们认为,默认情况下,这些算法应采用某种形式的信息性初始化。t-SNE 的另一个基本组成部分是使用核矩阵,即包含序列间两两距离的相似度矩阵。对于基于 t-SNE 的可视化,文献中默认采用高斯核。然而,我们表明核选择也在 t-SNE 的性能中起着关键作用。在这项工作中,我们评估了 t-SNE 在多种替代初始化方法和核下的性能,使用了四个不同的数据集,其中三个是从各种来源获得的生物序列(核苷酸、蛋白质等)数据集,例如著名的 SARS-CoV-2 病毒序列数据库 GISAID。我们对这些替代方案进行了主观和客观评估。我们使用所得的 t-SNE 图和 k-ary 邻域一致性 (k-ANA) 来评估并将所提方法与基线进行比较。我们表明,通过使用不同的技术,例如知情初始化和核矩阵选择,t-SNE 的性能显著更好。此外,我们表明 t-SNE 通过更智能的初始化也以更少的迭代次数更快收敛。
引用
@article{arxiv.2211.09263,
title = {Informative Initialization and Kernel Selection Improves t-SNE for Biological Sequences},
author = {Prakash Chourasia and Sarwan Ali and Murray Patterson},
journal= {arXiv preprint arXiv:2211.09263},
year = {2022}
}
备注
Accepted to IEEE BigData 2022