T${}^2$K${}^2$: Twitter Top-K 关键词基准测试
数据库
2017-09-15 v1 信息检索
摘要
从文本数据中进行信息检索侧重于构建包含加权词元组的词汇表。此类词汇表随后可被各种文本分析算法利用以提取新知识,例如 top-k 关键词、top-k 文档等。top-k 关键词被随意用于各种目的,经常即时计算,因此必须高效计算。为了比较竞争的加权方案和数据库实现,基准测试是惯例。据我们所知,目前没有基准测试解决这些问题。因此,在本文中,我们提出了一个 top-k 关键词基准测试 TK,其特色是真实推特数据集和具有不同复杂度与选择率的查询。TK 有助于从计算性能方面评估加权方案和数据库实现。为了说明 TK 的相关性和通用性,我们成功地在 TF-IDF 和 Okapi BM25 加权方案上,以及在不同的关系型(Oracle、PostgreSQL)和面向文档的(MongoDB)数据库实现上进行了测试。
引用
@article{arxiv.1709.04747,
title = {T${}^2$K${}^2$: The Twitter Top-K Keywords Benchmark},
author = {Ciprian-Octavian Truică and Jérôme Darmont},
journal= {arXiv preprint arXiv:1709.04747},
year = {2017}
}