多维数据集中的最近邻关键词集搜索
数据库
2014-09-16 v1 信息检索
摘要
在富含文本的多维数据集中进行基于关键词的搜索,为许多新颖的应用和工具提供了便利。在本文中,我们考虑那些被标记了关键词并嵌入在向量空间中的对象。针对这些数据集,我们研究了一种查询,该查询要求找到满足给定关键词集的最紧密点群。我们提出了一种名为 ProMiSH(投影与多尺度哈希)的新方法,该方法使用随机投影和基于哈希的索引结构,并实现了高可扩展性和加速比。我们给出了该算法的精确版本和近似版本。我们在真实和合成数据集上的实证研究表明,ProMiSH 相比最先进的基于树的技术,加速比超过四个数量级。我们在高达 1000 万条数据、100 个维度、最多 9 个关键词查询的数据集上进行的可扩展性测试表明,ProMiSH 随数据集大小、数据集维度、查询大小和结果大小呈线性扩展。
引用
@article{arxiv.1409.3867,
title = {Nearest Keyword Set Search in Multi-dimensional Datasets},
author = {Vishwakarma Singh and Ambuj K. Singh},
journal= {arXiv preprint arXiv:1409.3867},
year = {2014}
}
备注
Accepted as Full Research Paper to ICDE 2014, Chicago, IL, USA