评估与改进邻域嵌入方法的可靠性:基于连续性视角
统计方法学
2025-04-02 v2 机器学习
统计计算
机器学习
摘要
可视化高维数据是理解生物医学数据和深度学习模型的关键。虽然t-SNE和UMAP等邻域嵌入方法在实际应用中被广泛使用,但可能引入误导性的视觉结构。我们发现,许多先前研究中关于流形学习的解释是不准确的,这些问题源于缺乏数据独立的嵌入图概念,这类图将高维数据投影到低维空间。利用留一法(leave-one-out)原理,我们引入LOO-map框架,将嵌入图扩展到整个输入空间。我们识别了两种形式的图不连续性会扭曲可视化结果:一种夸大了簇的分离,另一种则生成了虚构的局部结构。作为补救措施,我们开发了两种点诊断得分来检测不可靠的嵌入点并改进超参数选择,这些方法在计算机视觉和单细胞组学数据集上得到验证。
引用
@article{arxiv.2410.16608,
title = {Assessing and improving reliability of neighbor embedding methods: a map-continuity perspective},
author = {Zhexuan Liu and Rong Ma and Yiqiao Zhong},
journal= {arXiv preprint arXiv:2410.16608},
year = {2025}
}
备注
49 pages, 20 figures