高维非结构化数据中的类密度与数据集质量
机器学习
2022-02-09 v1 计算机视觉与模式识别
摘要
我们给出了类密度的定义,可用于度量高维非结构化数据集中每个类内样本的总体相似度。随后,我们提出了几种计算类密度的候选方法,并分析了各方法所得数值与训练模型上相应各类别测试准确率之间的相关性。此外,我们提出了高维非结构化数据的数据集质量定义,并表明那些达到某一质量阈值(在所研究的数据集上实验证明为 > 10)的数据集可基于各类别密度来剔除冗余数据。
引用
@article{arxiv.2202.03856,
title = {Class Density and Dataset Quality in High-Dimensional, Unstructured Data},
author = {Adam Byerly and Tatiana Kalganova},
journal= {arXiv preprint arXiv:2202.03856},
year = {2022}
}
备注
13 pages, 27 tables