中文

MISSION: 基于 Count-Sketch 的超大尺度特征选择

数据结构与算法 2018-06-13 v1 机器学习 机器学习

摘要

特征选择是机器学习中的一项重要挑战,它在机器驱动决策(正迅速渗透现代社会)的可解释性方面起着关键作用。遗憾的是,现实世界数据集规模与维度的爆炸式增长对标准特征选择算法提出了严峻挑战。如今,数据集拥有数十亿维度已不罕见。在此尺度下,即便存储特征向量也不可能,导致大多数现有特征选择方法失效。特征哈希(feature hashing)等权宜之计作为大规模机器学习的标准方案,虽有助于计算可行性,却以牺牲特征可解释性为代价。本文提出 MISSION,一种用于超大尺度特征选择的新框架,其在利用 Count-Sketch 数据结构于内存中维护特征高效表示的同时执行随机梯度下降。MISSION 保留了特征哈希的简洁性,且不牺牲特征可解释性,同时仅使用 O(log2(p))O(\log^2(p)) 工作内存。我们证明 MISSION 能在具有数十亿维度的真实世界大规模数据集上准确且高效地执行特征选择。

关键词

引用

@article{arxiv.1806.04310,
  title  = {MISSION: Ultra Large-Scale Feature Selection using Count-Sketches},
  author = {Amirali Aghazadeh and Ryan Spring and Daniel LeJeune and Gautam Dasarathy and Anshumali Shrivastava and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:1806.04310},
  year   = {2018}
}