流式二进制编码
数据结构与算法
2015-03-24 v1
摘要
大数据正变得无处不在,涵盖海量视频库、文档语料库、图像集和互联网路由历史。邻近搜索和聚类是数据分析的两个基本算法原语,但在这些巨型数据集上却遭受“维数灾难”的困扰。解决此问题的一种流行方法是将对象表示转换为短二进制码字,同时近似保留近邻结构。然而,关于在通常适用于此类数据规模的“流式”或“在线”设置中构建码字的研究有限,在这种设置中,对于大到无法装入本地内存的数据,可能只能进行单次遍历。在本文中,我们应用矩阵草图技术的最新进展,在流式和在线设置中构建二进制码字。我们的实验结果优于几种最常用的算法,并且我们在对数据和训练集随机性做出温和假设的前提下,证明了流式设置下性能的理论保证。
引用
@article{arxiv.1503.06271,
title = {Binary Coding in Stream},
author = {Mina Ghashami and Amirali Abdullah},
journal= {arXiv preprint arXiv:1503.06271},
year = {2015}
}
备注
5 figures, 9 pages