使用 Procrustes 验证集进行共线性数据集增强
机器学习
2023-12-11 v1
摘要
在本文中,我们提出了一种用于数值和混合数据集增强的新方法。该方法通过利用交叉验证重采样和潜变量建模来生成额外的数据点。它对于具有中等到高度共线性的数据集特别有效,因为它直接利用这一特性进行生成。该方法简单、快速且参数极少,如文中所示,这些参数不需要特定调优。它已在多个真实数据集上进行了测试;我们在此报告两个案例的详细结果:基于近红外光谱预测碎肉中的蛋白质(具有高度共线性的纯数值数据)和区分转诊进行冠状动脉造影的患者(同时包含数值和分类变量的混合数据,具有中等共线性)。在这两种情况下,均采用人工神经网络来开发回归和判别模型。结果表明模型性能有显著提升;因此,对于肉蛋白预测,将模型拟合到增强数据上,使得在独立测试集上计算的均方根误差降低了 1.5 到 3 倍。
引用
@article{arxiv.2312.04911,
title = {Collinear datasets augmentation using Procrustes validation sets},
author = {Sergey Kucheryavskiy and Sergei Zhilin},
journal= {arXiv preprint arXiv:2312.04911},
year = {2023}
}
备注
21 pages, 7 figures