中文

使用低偏差点进行机器学习中的数据压缩:实验比较

机器学习 2024-12-16 v2 机器学习

摘要

低偏差点(也称为准蒙特卡罗点)是单位立方体中确定性且巧妙选择的点集,提供均匀分布的近似。我们探讨了两种基于此类低偏差点的方法,以减少大数据集的大小,以训练神经网络。第一种方法是 Dick 和 Feischl 的方法,依赖于数字网络和平均过程。受我们实验发现的启发,我们构建了第二种方法,同样使用数字网络,但采用 Voronoi 聚类而非平均。两种方法与 [14] 的超压缩方法进行比较,后者是 K 均值聚类算法的一个变体。比较以不同目标函数的压缩误差和神经网络训练准确率进行。

关键词

引用

@article{arxiv.2407.07450,
  title  = {Using Low-Discrepancy Points for Data Compression in Machine Learning: An Experimental Comparison},
  author = {Simone Göttlich and Jacob Heieck and Andreas Neuenkirch},
  journal= {arXiv preprint arXiv:2407.07450},
  year   = {2024}
}