中文

大数据分析与搜索发现的未来:超度量信息空间

信息检索 2012-02-17 v1 机器学习

摘要

考虑由 n 个观测向量组成的观测数据,这些向量在一组属性上取值。这构成了属性空间中的 n 个点。将数据结构化为树形(由观测嵌入超度量拓扑所隐含),为邻近搜索提供了巨大优势。如果通过此类嵌入对数据进行预处理,则可在常数计算时间(即 O(1) 时间)内找到观测值的最近邻。本文讨论了一种更强大的方法:以线性计算时间(即对于 n 个观测值为 O(n) 时间)诱导层级结构,从而生成树。正是基于这种邻近搜索和最佳匹配的基础,我们才能解决处理非常庞大且可能具有非常高维的数据集所面临的日益严峻的问题。

关键词

引用

@article{arxiv.1202.3451,
  title  = {The Future of Search and Discovery in Big Data Analytics: Ultrametric Information Spaces},
  author = {Fionn Murtagh and Pedro Contreras},
  journal= {arXiv preprint arXiv:1202.3451},
  year   = {2012}
}

备注

10 pages