中文

基于季节调整的大规模搜索引擎日志特征选择方法

机器学习 2020-08-25 v1 机器学习

摘要

搜索引擎日志在追踪与预测传染病暴发方面具有巨大潜力。更确切地说,人们可利用某些搜索词的搜索量近乎实时地预测传染病的感染率。然而,由于搜索日志具有以下双向不稳定性特征,利用搜索引擎日志进行准确且稳定的暴发预测是一项挑战。首先,搜索词的搜索量可能在短期内不规则变化,例如由于媒体或新闻量等环境因素。其次,搜索量也可能因搜索引擎用户人口结构变化而长期变化。也就是说,若以此类搜索日志训练模型而忽略该特征,当这些变化发生时,所得预测将包含严重误报。本工作中,我们提出一种新颖的特征选择方法以克服此不稳定性问题。具体而言,我们采用季节调整方法将每个时间序列分解为季节、趋势与不规则三个分量,并分别对各分量建立预测模型。我们还精心设计了特征选择方法以选取恰当的搜索词预测各分量。我们在十种不同传染病上进行了综合实验。实验结果表明,所提方法在十种疾病中的七种上预测精度优于所有对比方法,涵盖现已观测(now-casting)与预测(forecasting)设定。同时,所提方法在选取与目标疾病语义相关的搜索词上更为成功。

关键词

引用

@article{arxiv.2008.09727,
  title  = {Seasonal-adjustment Based Feature Selection Method for Large-scale Search Engine Logs},
  author = {Thien Q. Tran and Jun Sakuma},
  journal= {arXiv preprint arXiv:2008.09727},
  year   = {2020}
}

备注

The 25th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '19)