中文

提升面向测序数据的 t-SNE 效率:来自核函数选择的洞见

机器学习 2025-12-19 v1

摘要

降维技术对于可视化和分析高维生物测序数据至关重要。t 分布随机邻域嵌入(t-SNE)广泛用于此目的,传统上采用高斯核来计算成对相似度。然而,高斯核缺乏数据依赖性且计算开销大,限制了其对类别型生物序列的可扩展性和有效性。近期研究提出了孤立核作为替代方案,但它可能无法最优地捕捉序列相似度。在本研究中,我们使用独热编码、Spike2Vec 和 minimizers 三种嵌入方法,全面评估了应用于分子序列的 t-SNE 的九种不同核函数。通过主观可视化和客观指标(包括邻域保持分数),我们证明余弦相似度核总体上优于其他核(包括高斯核和孤立核),在低维空间中实现了更优的运行时间效率和对样本对距离更好的保持。我们通过在六个不同的生物数据集(Spike7k、Host、ShortRead、Rabies、Genome 和 Breast Cancer)上进行广泛的分类和聚类实验,采用多种机器学习算法和评估指标,进一步验证了我们的发现。我们的结果表明,核选择不仅显著影响可视化质量,还影响下游分析任务,其中余弦相似度核在不同数据类型和嵌入策略中提供了最稳健的性能,使其特别适用于大规模生物序列分析。

关键词

引用

@article{arxiv.2512.15900,
  title  = {Boosting t-SNE Efficiency for Sequencing Data: Insights from Kernel Selection},
  author = {Avais Jan and Prakash Chourasia and Sarwan Ali and Murray Patterson},
  journal= {arXiv preprint arXiv:2512.15900},
  year   = {2025}
}