在存在噪声的情况下校准降维超参数
应用统计
2024-09-20 v5 机器学习
摘要
降维工具的目标是构建高维数据的低维表示。这些工具被用于多种原因,例如降噪、可视化以及降低计算成本。然而,存在一个在其他建模问题中常被讨论但在降维中常被忽视的基本问题——过拟合。在其他建模问题的背景下,会采用特征选择、交叉验证和正则化等技术来对抗过拟合,但在应用降维时很少采取此类预防措施。两个最流行的非线性降维方法 t-SNE 和 UMAP 的先前应用在评估性能时未能将数据视为信号和噪声的组合。这些方法通常被校准以捕捉数据的整体,而不仅仅是信号。在本文中,我们论证了在校准超参数时承认噪声的重要性,并提出了一个使用户能够做到这一点的框架。我们使用此框架来探索在应用 t-SNE 和 UMAP 时超参数校准在数据过拟合中所扮演的角色。更具体地说,我们表明先前推荐的困惑度和 n_neighbors 值太小,会过拟合噪声。我们还提供了一个其他人可用于在存在噪声的情况下校准超参数的工作流程。
引用
@article{arxiv.2312.02946,
title = {Calibrating dimension reduction hyperparameters in the presence of noise},
author = {Justin Lin and Julia Fukuyama},
journal= {arXiv preprint arXiv:2312.02946},
year = {2024}
}
备注
22 pages, 35 figures