估计提交至搜索引擎的查询总量
信息检索
2021-01-26 v1
摘要
我们研究估计某一特定领域内、在给定时间段内提交至搜索引擎的查询搜索次数(体量)总和的问题。我们的统计模型假设搜索次数的分布遵循 Zipf 定律,且观测到的样本体量是按照三种可能情形相应有偏的。这些假设与经验数据、关键词研究实践以及用于统计查询频率的近似算法相一致。基于经验/模拟数据的性质,我们设计并实验了若干分布参数的估计量。对于连续数据,我们推荐使用针对高体量查询的非线性最小二乘回归(NLS),其中体量上界由著名的 Clauset、Shalizi 和 Newman(CSN)幂律参数估计给出。对于分箱数据,我们提出使用限于高体量查询的卡方最小化方法,其中上界由 CSN 方法的分箱版本获得。随后推导出查询总数与总体总搜索体量的估计,包括统计误差界。我们将这些方法应用于 2017 年以意大利语搜索的食谱与烹饪查询领域。样本查询的观测体量收集自 Google Trends(连续数据)与 SearchVolume(分箱数据)。针对两种情况计算了估计的查询总数与总体量,并对结果进行了比较与讨论。
引用
@article{arxiv.2101.09807,
title = {Estimating the Total Volume of Queries to a Search Engine},
author = {Fabrizio Lillo and Salvatore Ruggieri},
journal= {arXiv preprint arXiv:2101.09807},
year = {2021}
}
备注
Accepted on IEEE Transactions on Knowledge and Data Engineering. 13 pages, 14 figures