中文

Active Sampler:面向大规模复杂数据分析的轻量级加速器

数据库 2015-12-15 v1 机器学习 机器学习

摘要

近年来,“大数据”训练的“大模型”取得了惊人成果。大多数流行的模型训练算法是迭代式的。由于数据量激增,我们通常只能在每次迭代中处理训练数据的一小部分。典型地,数据或被均匀采样或被顺序访问。本文研究数据访问模式如何影响模型训练。我们提出一种Active Sampler算法,其中对模型具有更多“学习价值”的训练数据被更频繁地采样。目标是将训练精力集中在靠近分类边界的有价值实例上,而非明显案例、噪声数据或离群点。我们在理论上证明了Active Sampler的正确性与最优性,然后开发了轻量级的向量化实现。Active Sampler与大多数优化大规模数据分析效率的方法正交,并可应用于大多数通过随机梯度下降(SGD)算法训练的解析模型。大量实验评估表明,对于可比较的训练质量,Active Sampler能将SVM、特征选择和深度学习的训练过程加速1.6-2.2倍。

关键词

引用

@article{arxiv.1512.03880,
  title  = {Active Sampler: Light-weight Accelerator for Complex Data Analytics at Scale},
  author = {Jinyang Gao and H. V. Jagadish and Beng Chin Ooi},
  journal= {arXiv preprint arXiv:1512.03880},
  year   = {2015}
}

备注

12 pages