中文

一种针对多维与非均匀数据的新型数据预处理方法

计算机视觉与模式识别 2017-08-17 v1

摘要

我们正处于全面盛开的数据分析与数据科学时代。来自各种来源的各类数据极其丰富,例如基于生物特征的数据、卫星图像数据、chip-seq 数据、社交网络数据、基于传感器的数据等。这种数据丰富的结果是存储成本日益低廉,因此人们以及几乎所有商业或科学组织都在存储越来越多的数据。大多数真实数据是多维、非均匀且规模庞大的,以至于在分析之前需要进行独特的预处理。为了使数据可用于任何类型的分析,预处理是非常重要的一步。本文提出了一种针对多维和非均匀数据的独特且新颖的预处理方法,旨在使其变得均匀并在不丢失太多价值的情况下缩减规模。我们选择生物特征签名数据来演示所提出的方法,因为它符合多维、非均匀且规模庞大的属性。生物特征签名数据不仅捕获签名的结构特征,还捕获使用动态签名捕获设备获取的行为特征。当实时收集时,诸如笔压、笔倾角、签署文件所用时间等这些特征会呈现出不同的维度。该特征数据集连同结构数据需要进行预处理,以便用于训练基于机器学习的签名验证模型。我们通过生物特征签名数据的实验结果证明了所提出方法相对于其他方法的成功之处,但该方法同样可以应用于来自不同领域具有类似属性的任何其他数据。

关键词

引用

@article{arxiv.1708.04664,
  title  = {A Novel data Pre-processing method for multi-dimensional and non-uniform data},
  author = {Farhana Javed Zareen and Suraiya Jabin},
  journal= {arXiv preprint arXiv:1708.04664},
  year   = {2017}
}

备注

11 pages, 4 Figures, 7 Tables