基于多分量键索引的快速 K 词邻近搜索中最优参数的选择
信息检索
2021-01-12 v1
摘要
邻近全文搜索在当代全文搜索系统中普遍实现。我们假设搜索查询是一个词列表。若被查询词在文档中彼此邻近,则很自然地将文档视为相关。对于查询由高频出现词组成的情况,邻近因子更为重要。邻近全文搜索需要存储用户可搜索的每个词在文档中每次出现的信息。对于文档中每个词的每次出现,我们采用附加索引来存储邻近词的信息,即在距离给定词小于或等于 MaxDistance 参数范围内的词。我们在先前工作中表明,这些索引可将由高频词组成查询的平均查询执行时间提升多达 130 倍。本文中,我们考察搜索性能和搜索质量如何依赖于 MaxDistance 及其他参数的值。实验中使用知名的 GOV2 文本集以保证结果可复现。在分析实验结果后,我们提出了一种新的索引模式。此为发表于 Supplementary Proceedings of the XXII International Conference on Data Analytics and Management in Data Intensive Domains (DAMDID/RCDL 2020),俄罗斯沃罗涅日,2020 年 10 月 13-16 日,第 336-350 页,由 CEUR Workshop Proceedings 出版的论文预印本。最终认证版本可在线获取:http://ceur-ws.org/Vol-2790/
引用
@article{arxiv.2101.03327,
title = {Selection of Optimal Parameters in the Fast K-Word Proximity Search Based on Multi-component Key Indexes},
author = {Alexander B. Veretennikov},
journal= {arXiv preprint arXiv:2101.03327},
year = {2021}
}
备注
Indexing: Scopus