通过自编码器和随机森林近似性提升监督可视化以实现超出样本扩展
机器学习
2024-06-10 v1 机器学习
摘要
监督维度约化的价值在于揭示数据特征与标签之间的有意义联系。常见的维度约化方法嵌入一组固定的潜在点,但无法对未见的测试集进行泛化。在本文中,我们提供一种用于随机森林基于监督维度约化方法(RF-PHATE)的超出样本扩展方法,结合随机森林模型所学习的信息与自编码器的函数学习能力。通过对各种自编码器架构进行定量评估,我们确定重建随机森林近似性的网络更适合解决嵌入扩展问题。此外,通过利用基于近似性的原型,我们在不损失扩展质量的情况下实现了训练时间约 40% 的减少。我们的方法不需要对超出样本点的标签信息,从而作为一种半监督方法,仅使用 10% 的训练数据即可实现一致的质量。
引用
@article{arxiv.2406.04421,
title = {Enhancing Supervised Visualization through Autoencoder and Random Forest Proximities for Out-of-Sample Extension},
author = {Shuang Ni and Adrien Aumon and Guy Wolf and Kevin R. Moon and Jake S. Rhodes},
journal= {arXiv preprint arXiv:2406.04421},
year = {2024}
}
备注
7 pages, 3 figures