中文

2-bit随机投影、非线性估计器与近似近邻搜索

机器学习 2016-02-23 v1 数据结构与算法 机器学习

摘要

随机投影方法已成为机器学习、数据挖掘和 Web 规模海量数据搜索的标准工具。有效使用随机投影需要将(实值)投影数据高效编码量化为整数。本文关注简单的 2-bit 编码方案。特别地,我们基于 2-bit 策略开发了精确的非线性数据相似度估计器。该工作有重要实际应用。例如,在近邻搜索任务中,关键步骤(常称重排序)是在哈希表技术识别出一组候选数据点后计算或估计数据相似度。该重排序步骤可利用所提编码方案和估计器。作为相关任务,本文还研究了用于构建投影数据哈希表的简单均匀量化方案。分析表明通常仅需少量比特。例如,当目标相似度水平高时,2 或 3 比特可能足够;当目标相似度水平不太高时,优选仅 1 或 2 比特。因此,2-bit 方案总体似乎是经由哈希表的亚线性时间近似近邻搜索任务的良好选择。结合这些结果,我们得出结论:对于近似近邻搜索和相似度估计,推荐使用 2-bit 随机投影。提供了大量实验结果。

关键词

引用

@article{arxiv.1602.06577,
  title  = {2-Bit Random Projections, NonLinear Estimators, and Approximate Near Neighbor Search},
  author = {Ping Li and Michael Mitzenmacher and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:1602.06577},
  year   = {2016}
}

备注

arXiv admin note: text overlap with arXiv:1403.8144